声音是随时间变化的气压
说话推动空气形成微小压力变化,麦克风把变化转成电信号,数字录音再按固定时间间隔采样。波形横轴是时间,纵轴近似表示瞬时振幅;它能显示静音、爆破和周期性,却不会自动标出“这是一个音位”。
录音是测量链,不是透明窗口。麦克风频率响应、距离、房间反射、增益、压缩和文件格式都会改变信号。比较组间差异前,应固定设备与位置,记录采样率、位深、环境和后处理。
采样率限定可表示的频率
离散采样能可靠表示的最高频率低于采样率一半,这来自奈奎斯特限制。语音研究常用 44.1 或 48 kHz 录音,足以覆盖多数可听语音信息;降低采样率前需要抗混叠滤波,否则高频会伪装成低频成分。
位深影响可表示动态范围,但更高参数不能修复削波或噪声。保存无损主文件、另做发布副本,比反复转码有损格式更适合可复核研究。
频谱把复杂声波分解为频率成分
周期或近周期声波可视为多个不同频率、振幅和相位成分的叠加。傅里叶分析把时间信号转换为频率表示。单一频谱描述一个时间窗,频谱图则把许多时间窗排列起来:横轴时间、纵轴频率、颜色或灰度表示能量。
时间窗有分辨率权衡。长窗更能分开相近频率,却模糊快速变化;短窗保留时间边界,却使频率带更宽。所谓“宽带”和“窄带”频谱图不是画质高低,而是针对共振结构或谐波结构选择不同窗口。
声源与声道共同塑造语音
声带振动、湍流或爆破提供声源,咽腔、口腔和鼻腔作为滤波器增强某些频率。源—滤波理论帮助区分喉头周期与声道共振,但真实发音存在耦合、非线性和快速协同,模型是近似而非身体的完整复制。
浊音的谐波间距主要跟随基频,谐波包络的峰值受声道共振影响。把两者混为一谈会把“声音高低”和“元音音色”错误合并。
基频不是听觉音高本身
周期信号的基频 F0 近似对应声带振动重复率,并与听到的音高高度相关。音高是知觉量,还受强度、谐波、语境和听者影响。自动算法估计的是周期,不是直接读取心理体验。
倍频与半频错误常发生在气声、喉化、低强度或多声源片段。研究者应检查轨迹与波形,不应直接导出软件默认结果。跨说话者比较可使用半音或相对基线,但转换选择要与研究问题一致。
共振峰帮助描述元音
共振峰是声道传递函数中的共振区域,常以 F1、F2 等中心频率近似。许多元音中,F1 与舌位高低相关,F2 与前后位置相关,但关系受唇形、声道长度和协同动作影响,不能把二维图当作舌头照片。
线性预测编码会按模型阶数寻找共振峰。设置过低会漏峰,过高会把谱形细节当成峰;儿童、高基频说话者和后元音尤其容易追踪错误。应人工检查、报告参数,并用可重复脚本保存修正规则。
元音空间必须处理说话者差异
绝对 F1/F2 同时反映语言类别与声道尺寸。直接比较成人男性、女性和儿童,可能把解剖差异误当方言差异。元音归一化尝试保留类别关系、减少说话者尺度影响,但不同方法会改变距离和分布。
没有对所有问题最好的归一化。研究应展示原始值与变换值,说明参考元音是否齐全、算法是否适合样本,并避免把群体平均点当成每个成员的固定发音。
辅音留下时间与频率线索
塞音可观察闭塞、爆破和嗓音起始时间,擦音可比较噪声谱重心、离散度与时长,鼻音有低频共振和反共振,边音与近音则改变共振峰过渡。任何单个指标都很少等于一个类别。
例如嗓音起始时间受发音部位、语速、元音和说话者影响。跨语言对立需要看分布及知觉边界,而不是用英语阈值给所有语言分类。
时长测量依赖边界定义
“元音从哪里开始”可能按周期性、共振峰可见度、能量或听觉判断定义。不同定义在清晰样本上接近,在弱化和共发音中会分叉。标注指南应给正例、边缘例与优先规则。
测量者一致率不只是报告一个相关系数。连续时长可用绝对差、组内相关或 Bland–Altman 图检查系统偏差;类别边界可用一致率和校正偶然一致的指标。分歧本身能暴露定义不足。
强度与响度也不能直接等同
声压级以对数尺度表示物理振幅,响度是频率、时长、听者和背景共同决定的知觉。录音增益未校准时,文件中的振幅不能比较真实声压。相对强度仍可研究重音或韵律,但要控制麦克风距离。
自动增益、降噪和视频会议压缩会压平动态变化。采集自然在线互动时必须把这些处理作为数据生成条件记录。
语调需要形状、对齐与范围
语调研究不只看平均 F0。重音峰出现在哪个音节、相对边界何时转折、说话者整体范围和短语末尾怎样变化都可能承载意义。ToBI 等标注体系把音高事件和韵律边界编码,但需要语言特定分析。
把一门语言的高低调标签直接套给另一门语言,会忽略声调、重音和语调的接口。声调语言中,词汇声调与句子语调可同时改变 F0,分析需建立局部基线和替代线索。
声音类别是多线索概率判断
听者利用共振峰、时长、基频、噪声、过渡和词汇语境组合识别。相同物理值在不同说话者或相邻音中可被听成不同类别,这称为知觉归一化与语境效应的一部分。
声学图上“看起来分开”不保证听者使用该差异;听觉上明显也不保证某一仪器指标单独解释。产出测量应与感知实验互相约束。
统计模型必须尊重重复结构
语音数据通常包含每位说话者多个词、每个词由多人产生。把所有标记当独立样本会低估不确定性。混合效应模型可同时表示说话者和项目差异,并检验斜率是否因个体变化。
测量选择、排除阈值和变换应在观察结果前尽量确定。探索多个参数后只报告显著者会放大偶然结果;完整脚本和稳健性分析比一张漂亮元音图更重要。
自动语音技术不是中性测量仪
强制对齐、说话人分离和自动转写可处理大语料,但模型在训练语言、口音、年龄、噪声和障碍言语上的误差不同。错误会集中在研究最关心的变体,而非随机消失。
自动标注应抽样人工核验、按群体报告错误,并保留原始音频与模型版本。不得因系统只支持某些语言,就把其他使用者排除出“可分析语音”。
语音数据具有可识别性
声音包含身份、健康、情绪和环境线索,即使删除姓名也可能被熟人认出。公开语料前要说明下载、声纹模型训练和未来商业使用,允许限制音频而开放派生测量。
儿童、政治敏感社群和濒危语言记录尤其需要分级访问。研究可复现不等于原始声音必须对任何用途无限公开。
一套可复核的测量流程
先把理论构念写成操作定义,确定采样、设备和目标片段;再用小样本试测参数与边界规则。正式分析保存原始文件、无损工作副本、TextGrid 或同类标注、测量脚本和版本信息。
随后检查轨迹异常、测量者差异和群体不均衡,报告原始分布、模型不确定性与替代参数。Praat 等工具提供测量能力,真正的科学证据来自透明定义、校准和可复核决策。
跨域连接
- 波与声学:语音的物理基础就是管腔声学——声带提供准周期声源,声道作为可变形的共鸣管选择性放大某些频率。共振峰不是「元音的属性」,而是管腔几何的解,这也是为什么改变舌位就改变元音:你改的是共鸣腔的形状,不是发出的声音本身。
- 傅里叶分析 与 快速傅里叶变换:频谱图是短时傅里叶变换的可视化,而窗长的选择直接制造了时间分辨率与频率分辨率的取舍——宽带谱看得清声门脉冲却看不清谐波,窄带谱正好相反。语音学里许多「测量分歧」,本质上是窗参数分歧。
- 信号处理:采样率决定可表示的最高频率,这是奈奎斯特限制的直接后果。用 8 kHz 采样的电话语音去研究擦音,不是精度不够,而是相关频段根本不在数据里——这类限制必须在设计研究时就确认,事后无法补救。
- 统计学:同一说话人的多次发音高度相关,把它们当作独立观测会系统性高估证据强度。语音数据几乎总是嵌套结构(重复 × 词 × 说话人),混合效应模型不是可选的精细化,而是正确性要求。
- 音位与音系系统:声学测量给出连续值,音系分析处理离散范畴,两者的接口是多线索概率判断——没有任何单一声学参数能划出范畴边界,听者整合的是一组彼此可替代的线索。
参考文献
- Ladefoged, Peter, and Keith Johnson. A Course in Phonetics. 7th ed., Cengage, 2015.
- Johnson, Keith. Acoustic and Auditory Phonetics. 3rd ed., Wiley-Blackwell, 2012.
- DiCanio, Christian. “Visualizing the Phonetics of Speech.” Language Documentation & Conservation 15 (2021).
延伸阅读
- Boersma, Paul, and David Weenink. Praat: Doing Phonetics by Computer. 官方手册