计算语言学研究可执行的语言模型
计算语言学把语言假说写成算法、概率模型或形式系统,既可解释人类语言结构,也可构建分词、解析、翻译、检索和对话工具。自然语言处理更强调系统任务,两者重叠却不完全相同。
一个系统在任务上有用,不表示其内部机制等同人类;一个认知模型也未必适合生产部署。首先要说明目标是解释、预测还是工程效用。
文本进入模型前已被表示
计算机接收字符序列,系统再按字符、子词、词或字节切分。分词器决定词汇表和序列长度,常见子词算法把高频片段合并,让开放词汇可由有限单位组成。
分词不是中性预处理。黏着语言、无空格文字、拼写变体和低资源语言可能被切成更多碎片,增加计算成本并改变模型可学模式。应按语言报告压缩率和未知处理。
词袋模型保留频率却丢失顺序
早期文本分类常以词频或 TF–IDF 向量表示文档,简单、可解释且在许多任务仍有竞争力。它忽略长距离顺序,却能作为强基线,防止复杂模型只利用主题词便被误称理解句法。
特征工程可加入字符 n-gram、词性和依存,但每项特征都嵌入语言假设。基线表现应与数据泄漏检查一起报告。
分布式表示从使用环境学习相似性
词嵌入把词映射为向量,共现相似的词在空间中接近。向量能支持类比、聚类和下游任务,也会继承语料中的刻板印象、频率和体裁偏差。
一个词一个向量无法处理多义,上下文表示则随句子改变。几何接近是统计关系,不是完整词义或世界知识。
序列模型学习条件概率
n-gram 模型估计前若干单位给定时下一个单位概率,透明但稀疏;循环神经网络和 LSTM 用隐藏状态压缩更长历史;Transformer 通过注意力并行建模位置间关系。
语言模型目标是预测序列,不预先保证真值、意图或因果理解。强大的序列预测可以产生有用表征,能力边界仍需任务与干预检验。
注意力不是自动解释
Transformer 的注意力权重表示某层计算中信息混合比例,多个头、残差和非线性共同决定输出。高权重不必等于模型“关注理由”,改动权重也未必按解释预期改变预测。
可解释性需要反事实干预、探针控制、因果追踪和行为误差结合。彩色热图是分析线索,不是心理解释终点。
预训练与微调改变数据分工
大规模自监督预训练从未标注文本学习一般表示,再通过监督微调、指令数据或偏好优化适应任务。这样减少每项任务的标签需求,却把训练语料来源、许可和偏差集中到基础模型。
模型卡和数据说明应记录用途、群体、语言、已知失败和评测。无法审计训练数据时,用户更难判断某种能力来自记忆、泛化还是泄漏。
解析把句子映射为结构
成分解析生成嵌套短语,依存解析连接中心词与依存词。Universal Dependencies 试图用共享标签支持跨语言比较,同时允许语言特定说明。解析器误差受句长、体裁和标注体系影响。
高总体准确率可能掩盖否定、长距离依存或少数语言构式失败。结构评测应按关系、距离和语言分解,并与人工一致上限比较。
机器翻译不仅替换词
翻译系统要处理词序、形态、指称、语用和文化约定。神经翻译改善流畅度,却可能省略、增添或把不确定内容说得确定。参考译文也不是唯一正确答案。
BLEU 等指标比较 n-gram 重叠,适合系统级趋势但对语义与社会风险不充分。医疗、法律和濒危语言场景需要人工评估准确、术语、一致性和伤害。
生成式模型的流畅与真实性分离
自回归模型优化下一个 token 概率,能生成连贯文本,也会在缺少证据时产生看似可信陈述。检索增强可提供来源,仍需验证检索相关性、引用是否支持结论和生成是否忠实。
把“幻觉”当偶发 bug 会低估目标结构。系统设计要允许拒答、显示不确定性、约束高风险动作并保留人工责任。
基准必须定义能力和污染边界
基准把任务、数据和指标固定,促进比较,但模型可能见过测试数据,开发者也会对榜单反复调参。单一总分混合语言、难度和错误成本,不能代表真实部署。
应使用隐藏测试、时间后切分、对抗最小对照和外部场景验证。每次基准迭代都要说明测试的是记忆、模式匹配还是可迁移规则。
探针能读出信息却不证明模型使用它
线性探针若能从表示预测词性,说明信息可解码,不表示主任务决策依赖该信息。高容量探针甚至可自行学习任务。控制任务、最小描述长度和表示干预帮助限制解释。
认知比较同样谨慎:模型与人类在相同句子上表现相似,可能利用不同捷径。错误关联、学习曲线和资源限制比单点相关更有诊断力。
低资源不是语言本身属性
所谓低资源描述数字数据、工具和投资不足,不表示语言结构贫乏。殖民历史、标准化、许可、键盘和机构能力决定哪些语言进入训练集。把资源差异归因说话者人数会遗漏政治经济。
跨语言迁移和多语模型可帮助,但常偏向与高资源语言共享文字或结构的语言。评测应报告具体变体、文字和领域,而不只按语言名称汇总。
数据采集涉及许可、劳动与同意
网页可访问不等于允许训练所有模型,语料中的作者、标注员和语言社群可能没有知情。敏感对话、临床记录和原住民知识需要更强治理,删除请求也应传播到派生版本。
数据说明应记录来源、许可、标注劳动、过滤和代表性。模型规模不能把权利问题变成技术细节。
偏差评测需要从刻板印象走向分配后果
词嵌入和生成模型会复现性别、族群、阶层与方言关联。模板测试可发现差异,却可能用外部群体标签制造不自然句子。真实风险还包括招聘排序、审核误杀和服务质量差异。
公平没有单一指标。应与受影响社群定义任务、错误成本和可接受权衡,分别报告性能与伤害,而不是用一个去偏分数宣布解决。
鲁棒性要覆盖分布变化
模型在同来源随机测试集表现好,面对新时间、新平台、拼写、口音或专业领域可能下降。数据增强和领域适应有帮助,但每次部署仍需持续监测。
对抗样本揭示脆弱性,却不一定代表自然频率。鲁棒评测应同时包含自然变化、压力测试和最坏后果,并设回滚条件。
系统指标必须连接用户任务
摘要 ROUGE、翻译 BLEU、分类 F1 和困惑度便于迭代,却只是代理。最终需要测用户能否更准确、高效和公平地完成任务,以及自动化是否改变工作负担与责任。
在线 A/B 测试也非价值中性,点击增加可能来自误导。高风险功能应优先离线安全评估、分阶段发布和事件审计。
计算成本是模型选择的一部分
训练和推理消耗能源、硬件、水和工程劳动,成本又决定哪些机构能研究与部署。更大模型可能提高平均指标,却增加延迟、集中化和环境负担。
报告参数、计算量、硬件、能耗估计和小模型基线,有助于评价边际收益。效率是科学与公共责任指标,不只是商业优化。
复现需要代码、数据和环境三者
随机种子不足以保证深度模型完全确定,库版本、硬件和数据顺序都可能影响。应保存配置、依赖、检查点、数据版本与评测脚本,并报告多次运行方差。
无法公开模型或数据时,至少提供接口行为、模型卡和受控复核路径。不可复核的排行榜提升不能支持广泛能力主张。
怎样审查一个 NLP 系统
先写清任务、用户、决策权和错误后果,再检查数据来源、分词、基线、泄漏和分组表现。随后区分离线指标、语言能力解释与真实用户效用,不让三者互相冒充。
最后测试分布变化、低资源语言、可访问性、隐私和失败恢复。优秀计算语言学不是只让模型生成更像人的句子,而是让模型假设、证据和社会边界都可被审计。
跨域连接
- 注意力与 Transformer:注意力权重常被当作模型的解释,但权重显示的是信息流经哪里,不是模型据此做了判断。这与语言学里探针实验的教训一致:能从表示中读出句法信息,不等于模型在生成时使用了它。两个学科在这里犯的是同一个错误,也各自发展出了同一类反驳。
- 深度学习架构 与 机器学习:从词袋到分布式表示再到序列模型,每一步都在改变「语言被表示成什么」。架构的选择即是理论承诺——词袋假设顺序无关,注意力假设任意位置可直接交互,这些假设对语言是否成立,是语言学问题而非工程问题。
- 大语言模型:流畅与真实性分离,是这一代模型最需要向外解释的性质。生成合乎语法的句子与生成为真的陈述,本就由不同机制保证——前者可由分布统计习得,后者需要与世界的对应关系,而训练目标里并不包含后者。
- 统计学:基准评测的核心困难是统计困难:污染边界、多重比较、测试集与训练集的分布重叠。报告一个数字而不报告它的方差与污染检查,在统计上等于没有报告。
- 语料库语言学:低资源不是语言的属性,而是数据采集史的属性。语料库语言学关于抽样、许可与代表性的整套规范,正是当前大规模训练数据最欠缺的部分。
参考文献
- Bender, Emily M., and Alexander Koller. “Climbing towards NLU.” ACL 2020. ACL Anthology
- Bender, Emily M., et al. “On the Dangers of Stochastic Parrots.” FAccT 2021.
- Mitchell, Margaret, et al. “Model Cards for Model Reporting.” FAT 2019.
延伸阅读
- Jurafsky, Daniel, and James H. Martin. Speech and Language Processing. 3rd ed. draft.