登录

科学网—面向AI时代的声学基础原理


速读:面向AI时代的声学基础原理面向AI时代的声学基础原理精选。 本文从最基础的“声音是什么”讲起,把前文已经讨论的dB、RMS、能量、功率、SNR/SIR、距离衰减和声源叠加扩展到频谱、传播、房间声学、听觉、麦克风阵列、数字信号处理,并进一步说明这些概念如何进入现代AI声学系统。
面向 AI 时代的声学基础原理 精选

已有 280 次阅读

2026-9-7 13:52

| 系统分类: 科普集锦

声学AI基础:从声波方程到声学智能

声波 · 分贝 · RMS · 频谱 · 传播 · 听觉 · 阵列 · 信号处理 · 机器学习

引言 声音首先是物理现象,其次才是数据;AI 首先要理解数据,而可靠的声学 AI 最终仍要回到物理。掌握基础声学,不是为了记住更多公式,而是为了知道每个数字、每张频谱图、每个模型输出究竟代表什么。

前言:AI 时代为什么更需要声学基础

过 去,声学工程师面对的是麦克风、扬声器、滤波器、混响室和示波器;今天,我们又多了神经网络、Transformer、扩散模型和大规模声学数据。工具变了,但声音的物理本质没有变。一个模型可以在海量数据上学习“什么声音像什么”,却不会因为参数更多,就自动获得“什么是声压、什么是声强、为什么近场和远场不同、为什么两个相同声源有时加 3 dB 有时加 6 dB”的物理常识。

真正可靠的声学智能系统,通常建立在三层基础之上:第一层是波动与能量的物理规律,第二层是采样、频谱、滤波、阵列等信号处理规律,第三层才是统计学习与人工智能。三层并不是互相替代,而是逐层抽象。

本文从最基础的“声音是什么”讲起,把前文已经讨论的 dB、RMS、能量、功率、SNR/SIR、距离衰减和声源叠加扩展到频谱、传播、房间声学、听觉、麦克风阵列、数字信号处理,并进一步说明这些概念如何进入现代 AI 声学系统。

内容导览

· 1. 声音的物理本质:压力扰动、波动方程、声速与波长

· 2. 三个描述声音的基本维度:幅度、频率与相位

· 3. 分贝世界:10log、20log、SPL、dBFS 与动态范围

· 4. RMS、能量与功率:如何定量描述一段声音

· 5. 时域到频域:傅里叶变换、频谱、STFT 与声谱图

· 6. 数字声音:采样、混叠、量化与 ADC/DAC

· 7. 声音如何传播:扩散、吸收、反射、折射、衍射与散射

· 8. 房间与环境:混响、脉冲响应、RT60 与多径

· 9. 声音如何叠加:相干、不相干、驻波与干涉

· 10. SNR、SIR、SINR 与常见算法指标

· 11. 人如何听声音:响度、音高、掩蔽与空间听觉

· 12. 麦克风与扬声器:从物理声场到电信号

· 13. 麦克风阵列与空间声学:延时、波束形成和阵列增益

· 14. 经典声学信号处理:滤波、卷积、相关、AEC、ANC、去混响

· 15. 声学如何进入 AI:表示、任务、模型与数据

· 16. 物理声学与 AI 融合:约束、先验、数字孪生与世界模型

· 17. 一个现代声学 AI 系统从声音到决策的完整链路

· 18. 常见误区与工程速查表

1. 声音的物理本质:声音不是 “ 文件 ” ,而是介质中的机械波

电脑里的 WAV/MP3/AAC/OGG 文件不是声音本身,它只是声音被传感器采样后的数字表示 (比如MP3就是一种音频编码格式) 。真正的声音,是空气、水、固体等介质中由机械振动引起的压力、密度和粒子速度扰动。没有介质,普通声波就无法像电磁波那样在真空中传播。

1.1 声压:最常测量的声学量

在空气静止时,大气压大约为 10⁵ Pa,而我们听到的声音通常只是叠加在这个静态压力上的微小变化。麦克风主要感知的就是这种随时间变化的声压 p(t)。

p_total(t) = p_static + p(t)

声学里真正关心的通常是交流声压 p(t),而不是巨大的静态大气压。人耳在 1 kHz 附近的听阈参考声压约为 20 μPa,这也是空气声学声压级的常用参考值。

1.2 波动方程:声音为什么能够传播

在线性、小扰动条件下,声压满足经典波动方程。它说明某一点的压力变化会通过介质的弹性和惯性向周围传播:

∂²p/∂t² = c² ∇²p

其中 c 是声速。这个方程的意义不在于要求每个工程师都去求解析解,而在于提醒我们:声音具有传播速度、相位、边界条件和空间结构。现代声场模拟、波束形成、房间声学乃至物理约束神经网络,本质上都没有离开这条基本方程。

1.3 声速与波长

λ = c / f

波长 λ、频率 f 与声速 c 三者相互制约。在常温空气中,声速大约 343 m/s;在海水中大约 1500 m/s,但会受温度、盐度和压力影响。

主题:声音|面向AI时代|声学基础原理