机器学习可以在数千小时声音中找出人耳难以统计的模式,但聚类出信号类型不等于知道它们“说了什么”。人类翻译拥有双语者、共享情境和可询问的语义判断;动物交流研究往往只有声音、位置、行为和生理数据。人工智能能加速发现结构,真正的语义仍需通过情境、预测与谨慎干预建立。
2024 年 Project CETI 团队分析东加勒比抹香鲸 8719 组咔嗒声序列,发现节奏、速度、rubato 式时值变化和附加点击可组合,形成比先前固定“coda 类型”更大的可区分空间。论文结论非常克制:系统具有情境敏感与组合结构,许多 coda 的交际功能仍未知。媒体常把它改写成“鲸鱼字母表已被翻译”,恰好显示前沿研究最需要守住的推理边界。
结构、功能与意义是三道门
第一道门是识别信号单位:哪些变化由发声者控制、接收者能感知,而非噪声或个体生理差异。第二道门是连接行为功能:某种信号是否预测集合、潜水、身份或轮次。第三道门才是语义:信号是否在不同情境稳定指向对象、关系或意图。复杂组合性增加表达容量,却不证明存在与人类词句相同的语法。
无监督模型可发现潜在类别,但类别数量受算法、距离度量和参数影响。模型也可能按录音设备、地点或个体聚类。研究需要跨年份、跨群体与跨设备复现,并用播放实验观察动物是否作出差异反应。播放必须避免造成压力、欺骗或改变社会关系,伦理边界与科学设计不可分。
数据采集是最大的基础设施
抹香鲸深潜、移动范围大,声音来源定位困难。CETI 结合水听器、机器人和长期个体识别,把声学序列与谁对谁、何时、在做什么连接。没有这种情境标签,再大的音频模型也只能学习声音统计。不同物种还需要完全不同传感:鸟类视觉姿态、灵长类社会关系、蜜蜂舞蹈空间和象的次声都不能套用同一语料格式。
稀有行为与沉默同样重要。研究设备容易在可达地点记录常见信号,忽略夜间、迁徙、冲突或照护。训练数据若不覆盖社会生活,模型会把“最常录到”误作“最重要”。采样设计应报告个体、年龄、性别、群体、季节和环境噪声,而不是只报告片段总量。
“动物语言”这个词本身需要约束
广义语言可指复杂交流,狭义人类语言则包含开放生成、层级结构、位移和社会规范等属性。研究不必先决定动物是否“有语言”,而应逐项检验能力。把人类标准当唯一尺度会低估不同物种,把任何复杂结构称作语言又会夸大证据。比较语言学能贡献的是精确概念,而非给物种颁发语言证书。
生成信号带来更高风险。模型若能合成自然叫声,播放可能引导动物、扰乱配偶或捕食关系,并被用于捕猎。研究团队需要分级发布模型和数据,评估生态后果与社区利益。开源并非在所有物种和地点都自动正当。
未知边界与可证伪预测
- 组合特征是否在不同抹香鲸氏族共享,还是文化性方言?
- 某些信号能否在控制个体和情境后预测具体行为,并由播放实验引发相应反应?
- 跨物种基础音频模型学到的是通用声学,还是可迁移的交流结构?
- 研究者如何区分接收者理解信号与只是对声学新奇作反应?
- 一旦部分意义可解码,数据与模型应由谁治理,怎样防止商业和军事误用?
最强进展不会是一款万能“动物翻译器”,而是一串越来越严格的结果:稳定单位、互动中的控制、行为预测、受约束干预和跨群体复现。
研究成功也可能改变动物处境
如果模型能识别觅食、压力或群体信号,它可帮助调整航运、渔业与保护区管理;同样能力也可能被用于更有效追踪和捕猎。项目应在发布高分辨位置、实时检测器和生成模型前进行双重用途评估,并与保护机构和沿海社区共同制定访问层级。论文开放代码的常规不能自动盖过物种风险。
互动实验还必须考虑动物的同意无法按人类表格取得。研究者可采用最小干预、停止规则、长期行为监测和独立伦理审查,观察个体是否回避、受压或改变社会关系。生成信号尤其应先验证声强、频率与情境安全,并限制重复。理解另一个物种若以扰乱其交流为代价,就会在方法上否定研究目标。
跨项目比较需要共享表示却不能抹平物种差异。声学片段可统一保存时间、地点、设备和环境元数据,行为标签则应允许物种特定本体。模型若在多物种上预训练,应报告每种物种数据量和最差表现,防止常见鸟类或圈养动物主导特征。所谓通用音频模型必须证明对未见群体有增益,而非只在总体平均上更好。
野外团队还应保存模型无法分类的信号,因为异常片段可能是新行为,也可能揭示传感和采样边界。
跨域连接
- 语言能力如何演化 研究人类语言的生物与文化前提。动物组合系统可检验哪些成分早于人类出现,但相似结构可能独立演化,不能直接画成通往人类语言的阶梯。
- 动物行为 提供情境、个体识别和实验设计。声音模式只有与真实行为和社会关系连接才可能获得功能解释;人工智能不能替代长期自然史观察。
- 机器学习数据 揭示采样和标签决定模型能学到什么。录音数量巨大但情境稀薄时,扩大模型不一定提高语义;增加高质量同步行为数据可能更有价值。
- 语言哲学 区分信号、意向、指称与意义。动物研究迫使这些概念接受经验检验:若意义依赖共同实践,翻译就不能只做声学字典,还要理解一个物种的生活形式。
参考文献
- Sharma, P. et al. Contextual and combinatorial structure in sperm whale vocalisations. Nature Communications 15, 3617 (2024). DOI: 10.1038/s41467-024-47221-8.
- Andreas, J. et al. Toward understanding the communication in sperm whales. iScience 25 (2022). DOI: 10.1016/j.isci.2022.105041.
- Stowell, D. Computational bioacoustics with deep learning: a review and roadmap. PeerJ 10 (2022). DOI: 10.7717/peerj.13152.
- Sainburg, T., Thielk, M. & Gentner, T. Q. Finding, visualizing, and quantifying latent structure across diverse animal vocal repertoires. PLOS Computational Biology 16 (2020). DOI: 10.1371/journal.pcbi.1008228.
延伸阅读
- Project CETI. Annual Report 2024. 2024.