该从录音里算出什么交给程序?——音频特征的五个维度
到上一课为止,一段 30 秒的音乐已经变成了一串六十多万个数字(每秒记两万两千多次,记了三十秒)。直接把这串数字丢给分类程序不行——太长、太细、而且单独一个数说明不了任何事。所以要先算出一些摘要,这些摘要就叫音频特征。搜「该用什么音频特征」会搜到一份长长的名词清单,可这些名字回答的不是同一种问题。这一课不背清单,而是给出一张分类地图:任何一个音频特征,都可以用五个维度定位——抽象层级、时间范围、音乐属性、信号域、用什么方法算出来。
为什么需要音频特征
需要音频特征,有三个直接理由:
- 特征是对声音的一种描述。 那六十多万个数(每一个都是某一瞬间量到的一个值)本身不构成描述,它只是记录。
- 不同的特征抓住声音的不同侧面。 有的抓强弱,有的抓高低,有的抓变化快慢。没有哪一个能抓住全部。
- 要造出能听懂声音的系统,就得先有这些描述。 分类、识别、检索,全都建在特征之上。
关键在第二条:不同特征抓的侧面不同。 所以「哪个特征最好」这个问法本身不成立——就像问「体温计和 CT 哪个更好」。它们回答的不是同一个问题。
互动持续版
静态图文到这里,接下来让声音和图形动起来
购买后解锁完整课程,以及只有官网互动版才能提供的声音、动画和可操作实验。
- 完整声音对比、分步动画与 8 个交互实验
- 微信账号登录,手机和电脑同步访问
- 申请加入课程会员群,交流、反馈和接收更新
- 持续获得这门课程的勘误与内容升级