科学网—面向AI时代的声学基础原理
精选
已有 280 次阅读
2026-9-7 13:52
| 系统分类: 科普集锦
声学AI基础:从声波方程到声学智能
声波 · 分贝 · RMS · 频谱 · 传播 · 听觉 · 阵列 · 信号处理 · 机器学习
引言 声音首先是物理现象,其次才是数据;AI 首先要理解数据,而可靠的声学 AI 最终仍要回到物理。掌握基础声学,不是为了记住更多公式,而是为了知道每个数字、每张频谱图、每个模型输出究竟代表什么。
前言:AI 时代为什么更需要声学基础
过 去,声学工程师面对的是麦克风、扬声器、滤波器、混响室和示波器;今天,我们又多了神经网络、Transformer、扩散模型和大规模声学数据。工具变了,但声音的物理本质没有变。一个模型可以在海量数据上学习“什么声音像什么”,却不会因为参数更多,就自动获得“什么是声压、什么是声强、为什么近场和远场不同、为什么两个相同声源有时加 3 dB 有时加 6 dB”的物理常识。
真正可靠的声学智能系统,通常建立在三层基础之上:第一层是波动与能量的物理规律,第二层是采样、频谱、滤波、阵列等信号处理规律,第三层才是统计学习与人工智能。三层并不是互相替代,而是逐层抽象。
本文从最基础的“声音是什么”讲起,把前文已经讨论的 dB、RMS、能量、功率、SNR/SIR、距离衰减和声源叠加扩展到频谱、传播、房间声学、听觉、麦克风阵列、数字信号处理,并进一步说明这些概念如何进入现代 AI 声学系统。
内容导览
· 1. 声音的物理本质:压力扰动、波动方程、声速与波长
· 2. 三个描述声音的基本维度:幅度、频率与相位
· 3. 分贝世界:10log、20log、SPL、dBFS 与动态范围
· 4. RMS、能量与功率:如何定量描述一段声音
· 5. 时域到频域:傅里叶变换、频谱、STFT 与声谱图
· 6. 数字声音:采样、混叠、量化与 ADC/DAC
· 7. 声音如何传播:扩散、吸收、反射、折射、衍射与散射
· 8. 房间与环境:混响、脉冲响应、RT60 与多径
· 9. 声音如何叠加:相干、不相干、驻波与干涉
· 10. SNR、SIR、SINR 与常见算法指标
· 11. 人如何听声音:响度、音高、掩蔽与空间听觉
· 12. 麦克风与扬声器:从物理声场到电信号
· 13. 麦克风阵列与空间声学:延时、波束形成和阵列增益
· 14. 经典声学信号处理:滤波、卷积、相关、AEC、ANC、去混响
· 15. 声学如何进入 AI:表示、任务、模型与数据
· 16. 物理声学与 AI 融合:约束、先验、数字孪生与世界模型
· 17. 一个现代声学 AI 系统从声音到决策的完整链路
· 18. 常见误区与工程速查表
1. 声音的物理本质:声音不是 “ 文件 ” ,而是介质中的机械波
电脑里的 WAV/MP3/AAC/OGG 文件不是声音本身,它只是声音被传感器采样后的数字表示 (比如MP3就是一种音频编码格式) 。真正的声音,是空气、水、固体等介质中由机械振动引起的压力、密度和粒子速度扰动。没有介质,普通声波就无法像电磁波那样在真空中传播。
1.1 声压:最常测量的声学量
在空气静止时,大气压大约为 10⁵ Pa,而我们听到的声音通常只是叠加在这个静态压力上的微小变化。麦克风主要感知的就是这种随时间变化的声压 p(t)。
p_total(t) = p_static + p(t)
声学里真正关心的通常是交流声压 p(t),而不是巨大的静态大气压。人耳在 1 kHz 附近的听阈参考声压约为 20 μPa,这也是空气声学声压级的常用参考值。
1.2 波动方程:声音为什么能够传播
在线性、小扰动条件下,声压满足经典波动方程。它说明某一点的压力变化会通过介质的弹性和惯性向周围传播:
∂²p/∂t² = c² ∇²p
其中 c 是声速。这个方程的意义不在于要求每个工程师都去求解析解,而在于提醒我们:声音具有传播速度、相位、边界条件和空间结构。现代声场模拟、波束形成、房间声学乃至物理约束神经网络,本质上都没有离开这条基本方程。
1.3 声速与波长
λ = c / f
波长 λ、频率 f 与声速 c 三者相互制约。在常温空气中,声速大约 343 m/s;在海水中大约 1500 m/s,但会受温度、盐度和压力影响。