跳转到内容
← 返回研究前沿
比较与历史2023–20307 分钟阅读

语言类型学的抽样危机:两千四百种语言够代表人类语言吗

Sampling Bias and Causal Inference in Linguistic Typology

如果数据库里一百种语言都有某个语序,并不能直接推出人类语言偏好如此。它们可能来自同一语系,继承共同祖先;也可能在同一区域长期接触;还可能因为有书写传统和现成语法而更容易进入样本。语言不是相互独立的数据点。类型学的前沿,是在扩大覆盖的同时,把系谱、地理、记录质量和语言消失带来的选择偏差纳入推断。 2023 年 Gramb…

语言类型学Grambank抽样偏差系谱语言普遍性

如果数据库里一百种语言都有某个语序,并不能直接推出人类语言偏好如此。它们可能来自同一语系,继承共同祖先;也可能在同一区域长期接触;还可能因为有书写传统和现成语法而更容易进入样本。语言不是相互独立的数据点。类型学的前沿,是在扩大覆盖的同时,把系谱、地理、记录质量和语言消失带来的选择偏差纳入推断。

2023 年 Grambank 汇集约 2400 种语言、40 多万个语法数据点,成为当时最大的比较语法数据库之一。团队发现系谱约束对语法多样性非常重要,并模拟语言损失如何减少结构多样性。数据库规模是突破,真正的方法突破则是让每个数据点连接来源、语系与地理,并用系统发育方法避免把亲缘重复当独立证据。

大样本仍可能偏

世界语言分布极不均衡,大语系内部有大量近亲语言,小语系与孤立语言却可能记录稀薄。简单随机抽语言会被大家族主导;每语系抽一个又会忽略家族内部变化。研究设计必须由问题决定:估计全球结构频率、测试演化转变或研究区域扩散,需要不同抽样和权重。

缺失值也不是随机。难以记录的结构、材料不足的语言和已停止使用的语言更容易缺失;把缺失当“无该特征”会系统偏误。统计模型可以多重插补或显式建模缺失机制,但前提是数据库记录未知、无关和否定之间的区别,并保留来源置信度。

普遍性从绝对命题转向概率约束

早期类型学常提出“如果语言有 X,就一定有 Y”式蕴涵。大型数据库显示真正无例外的普遍性很少,但这不意味着语言完全任意。某些结构组合可能更稳定、更常被演化到,原因可能来自加工、学习、沟通效率、历史锁定或接触。前沿要比较这些机制,而不是把统计相关直接命名为认知普遍性。

系统发育模型把语言变化放在语系树上,估计特征转变率和祖先状态。但语言树本身不确定,横向借用又违反纯树结构。区域网络、接触变量与多个树样本可以做敏感性分析。若结论只在一棵树或一种编码下成立,就应被报告为脆弱。

数据库不是无主的自然样本

每个特征值来自语法书、文章、档案或语言使用者知识。大型项目容易让原始描述者与社区在最终论文中隐身。可持续基础设施应提供细粒度引用、纠错入口、版本记录和对来源社区有用的回馈。语言消失不只是数据行减少,而是人类不再能继续创造和解释这种结构。

自动从文本和语法书抽取特征可扩规模,但模型会偏向数字资源丰富语言,并把分析传统差异当语言差异。自动结果应带置信度、出处和人工复核。机器适合寻找候选证据,不应无痕填满数据库。

可检验问题

  • 加入系谱与地理控制后,哪些所谓普遍性仍然稳健,效应有多大?
  • 语言损失是否优先消除罕见结构组合,从而让未来样本看起来更“普遍”?
  • 编码者间差异与语法传统差异占观察变异多少,能否通过双重标注估计?
  • 接触网络模型是否比纯树模型更好预测特征分布?
  • 数据库贡献和收益如何回到记录不足语言的研究者与社区?

真正的进步不是给“世界语言有多种结构”一个更精确百分比,而是说明该数字对抽样、编码、历史模型和缺失机制有多敏感。

可复现不等于只有一套编码

语法分析本身存在理论差异,同一结构可能被不同描述传统划分成不同类别。数据库不应为了整齐而抹去争论,可保存原始描述、标准编码和备选编码,并让分析在多个编码方案上重复。若效应只在某套分类中出现,这不是数据库失败,而是说明结论依赖理论选择。编码手册、培训样本和编码者一致度都应随数据发布。

优先补缺也需要避免“猎奇”。算法可能根据统计稀有度推荐下一种语言,却忽略社区意愿、研究关系和当地能力。更公正的优先级应结合结构信息增益、语言活力、已有社区计划和可持续合作。研究经费若因某语言“能填数据库空格”而来,成果就应同时支持当地记录、教育或档案目标,而不是取完特征后离开。

数据库结论还应进行留一语系和留一区域检验。每次暂时移除一个大家族或语言区,观察效应是否仍在,可发现结果是否由单个密集样本驱动。对孤立语言和小语系则应报告高影响点,而不是因权重小而消失。稳健性图比单一显著性数值更能展示“人类语言”主张究竟覆盖多宽。

未来版本需要把新增、改码和删除写成可读变更日志。论文使用固定版本与永久标识,分析脚本保存筛选规则,才能在数据库更新后复现。活数据库与可复现研究并不冲突,前提是每个结论有可冻结的证据快照。

跨域连接

  • 语言类型学与跨语言共性 提供语序、形态和语法特征的基本比较。前沿把“列举差异”推进到带系谱和地理的推断,使普遍性主张能被明确证伪。
  • 系统发育学 提供树、祖先状态和转变率模型。语言却会横向借用;若接触强,网络或区域模型应明显改善拟合,这也是区分继承与扩散的经验测试。
  • 抽样偏差 说明更大样本不自动代表总体。类型学中的可得性偏差与医学、社会科学相似:记录丰富对象被重复观察,最稀有和最脆弱对象反而缺席。
  • 濒危语言与语言复振 揭示数据多样性与使用者多样性不可替代。保存一个特征编码不能保存语言实践;数据库关于损失的预测应转化为记录与复振资源优先级,而非旁观统计。

参考文献

  • Skirgård, H. et al. Grambank reveals the importance of genealogical constraints on linguistic diversity and highlights the impact of language loss. Science Advances 9, eadg6175 (2023). DOI: 10.1126/sciadv.adg6175.
  • Dryer, M. S. & Haspelmath, M. (eds.). The World Atlas of Language Structures Online. 2013.
  • Roberts, S. G. & Winters, J. Linguistic diversity and traffic accidents: Lessons from statistical studies of cultural traits. PLOS ONE 8 (2013). DOI: 10.1371/journal.pone.0070902.
  • Bromham, L. et al. Global predictors of language endangerment and the future of linguistic diversity. Nature Ecology & Evolution 6 (2022). DOI: 10.1038/s41559-021-01604-y.

延伸阅读

  • Glottobank. Grambank Documentation and Dataset. current release.