实验把理论差异转成可观察对照
语言理论常预测某形式在特定条件下更易理解、更自然或更可能产生。实验通过操控一个因素、控制其他差异并随机分配试次,检验结果是否随操控变化。它不是给直觉加数字,而是迫使竞争解释做出不同预测。
实验也不能取代语料与田野。它牺牲部分自然情境换取控制,结论范围由材料、任务、参与者和实施环境共同限定。
构念需要操作化
“复杂”“可预测”“礼貌”或“语言能力”不是仪器直接读数。研究者要说明用句法层级、条件概率、评分或反应时怎样表示构念,并承认每个指标包含其他过程。
操作化有效性要靠多方法和操控检查。若所谓句法复杂条件同时更长、更低频,观察到的代价不能唯一归因结构。
最小对照要真正最小
句子可接受性研究常构造只差一个关键因素的材料,例如是否有依存关系、是否跨越某边界。词汇、长度、合理性和语篇应尽量匹配,并用多组项目避免某一句偶然怪异主导结果。
自然语言因素难完全正交,拉丁方设计让每位参与者只看到每个项目一个版本,同时在群体中平衡条件。项目列表和分配方案应公开。
随机化切断系统混杂
参与者随机进入条件,使已知和未知背景平均分布,是因果推断的核心。试次顺序随机化或分块可减少疲劳与策略偏差;但学习、启动和携带效应有时要求明确顺序设计。
不能随机分配的语言经历,如双语身份或方言,只能作为观察性组别。组间差异可能来自教育、迁移和社会地位,统计控制不能保证消除未测混杂。
因变量应匹配理论时间尺度
可接受性评分反映综合判断,反应时和眼动更接近加工过程,产出选择显示竞争结果,声学测量展示动作实现,ERP 提供时间锁定神经差异。它们互有关联却不等价。
若理论关于最终语法知识,只用毫秒反应可能不充分;若理论关于增量预测,只看句末评分又太粗。先选构念,再选指标,而不是反过来围绕现有设备编故事。
评分尺度不是天然等距尺
李克特评分、有界滑杆和二选一会诱发不同策略。数值 6 与 7 的差不必等于 2 与 3,顺序模型有时比线性模型更适合。量表端点、说明和练习会改变参与者参照。
幅度估计和强制选择可补充,但没有无偏任务。重复多种材料并建模参与者尺度使用,比争论唯一正确量表更有价值。
反应时分布通常右偏
少量极慢试次会拉高平均值,机械删除超过两个标准差的值又依赖条件分布。对数正态、移位 Wald 或分位数分析可更贴近生成过程,选择应在看结果前确定。
速度与准确率存在权衡。条件更快但错误更多不能简单称促进,漂移扩散模型可分离证据积累与反应边界,但参数解释需要足够试次和模型检验。
功效取决于参与者、项目和效应结构
语言实验同时抽样参与者和句子项目,样本量不能只数人数。效应可能因参与者、词项和语言背景变化,混合模型需表示这些随机来源。
功效分析最好基于模拟,输入预期效应、方差、项目数和排除率。使用先前小研究的显著效应会高估功效;合理范围和敏感性曲线比单一魔法数字更诚实。
显著性不是效应的重要性
p 值描述在模型与零假设下数据至少如此极端的概率,不是零假设为真的概率,也不表示结果可重复。大样本可让微小差异显著,小样本则让有意义差异不显著。
应报告效应量、置信或可信区间、原始分布和理论最小重要差异。二元“显著/不显著”尤其不能证明两个条件彼此不同:一个显著另一个不显著不等于二者差异显著。
多重分析路径会制造偶然发现
若研究者尝试多种排除、时间窗、因变量和子组,只报告最显著结果,名义错误率失效。探索本身有价值,但必须与确认性检验分开。
预注册在采集或查看结果前冻结问题、样本、排除和模型,注册报告还可在结果未知时接受论文。偏离计划并非禁忌,只要透明标注并解释。
操控检查也可能改变主要任务
询问参与者是否注意到语法、情绪或身份线索,可验证操控,却可能让他们猜到目的。检查可放在末尾、用独立样本或使用不显眼指标,具体取决于污染风险。
失败操控不表示理论必错,而表示实验未创造预期差异。成功操控也不证明只有目标构念改变。
填充项和掩饰任务需要设计
若一半句子都不合语法,参与者会形成异常预期;若关键结构重复,他们可能学习或疲劳。填充项平衡答案、结构和自然度,掩饰研究目标,但不能引入新的条件相关线索。
材料列表应分析长度、词频、答案比例和局部重复。共享完整刺激能让复现实验定位差异。
儿童与临床实验有额外缺失机制
婴儿可能哭闹或转头,失语者可能疲劳,缺失往往与条件和能力相关。只分析完成全部试次的人会选择出更适应任务的样本。排除规则、停止标准和每条件有效试次要预先规定。
ManyBabies 等多实验室合作通过共同协议量化实验室、方法和语言背景差异。大团队不是自动正确,但能揭示单一实验室看不到的异质性。
线上实验扩大样本也改变环境
远程实验可接触更多地区和语言,却无法完全控制设备、延迟、噪声和帮助。浏览器反应时精度适合部分效应,不适合所有毫秒差异;音频播放和录音需校准测试。
线上参与不等于全球代表。平台支付、网络、识字和语言界面仍筛选群体,研究应报告招募渠道与设备分布。
跨语言实验需要功能等价
逐字翻译刺激会改变词长、频率、语法和文化合理性。跨语言研究应从同一理论操控出发,为每种语言构造自然材料,并分别预试,再比较标准化效应与结构差异。
同一任务在某语言可能依赖书面标点,在另一语言依赖形态。功能等价比表面相同更重要,语言特定调整必须记录。
因果推断需要明确估计目标
随机实验可估计特定操控在特定样本和实施条件下的平均效应。它不自动回答长期学习、政策或自然互动后果。外推需要机制、群体和环境证据。
中介分析想解释效应经何过程发生,但中介变量通常未随机化,因果要求更强。不要把条件→脑信号→行为的时间顺序直接当成已证实机制链。
重复失败可能来自多种差异
直接重复尽量保持材料与程序,概念重复用新操作检验同一理论。结果不同可能来自原效应偶然、样本差异、实施偏差或真实边界条件。事后为每次失败发明调节变量会让理论不可证伪。
多实验室、预先定义异质性分析和元分析能区分平均效应与环境变化。重复的目标是改进理论精度,不是给研究者贴可信标签。
开放材料不等于公开敏感数据
刺激、代码、匿名派生数据和分析环境通常可共享;声音、视频、临床和小社群数据可能需要受控访问。知情同意应在采集前说明共享层级,而不是结束后再决定。
可复现性可以通过合成数据、数据字典、容器和可信执行环境实现。开放原则必须与参与者安全和社群权利并行。
一份实验审查清单
从理论预测开始,检查操控是否唯一、材料是否多样、参与者与项目是否随机化、因变量是否匹配时间尺度。再看功效、排除、预注册、模型、效应量和全部分析路径。
最后问结果能外推到哪些语言、群体和场景,是否由语料或自然互动支持。实验的专业性不在设备昂贵,而在替代解释被逐步排除。
跨域连接
- 可重复性危机与开放科学:心理学经历的整套问题——研究者自由度、多重分析路径、发表偏倚、功效不足——在实验语言学中同样成立,而且语言学的项目(词、句子)本身就是随机来源,功效计算比典型心理学实验更复杂。预注册、开放材料与多实验室复制这些对策同样适用。
- 统计学:显著性不是效应的重要性,反应时分布右偏使均值不是好的集中趋势度量,多重比较会制造偶然发现。这些不是「统计学家的挑剔」,而是决定一项结果能否被相信的条件。
- 贝叶斯推断:贝叶斯因子能表达「支持零假设」这件事,而频率派的不显著只能说「没能拒绝」。在检验「某因素无效应」的理论主张时,这个区别是实质性的——许多语言学争论恰恰需要证据支持无差异。
- 认知偏差:可接受度判断必须被测量而非由研究者内省。研究者对自己理论所预测的句子有系统性的判断偏移,这不是诚信问题而是认知事实,也是为什么要用未受训练的被试与填充项。
- 语言田野调查:跨语言实验需要功能等价而非字面翻译——同一份材料在两种语言里可能激活不同的加工过程,此时组间差异测到的是材料差异而非语言差异。田野方法提供的正是判断等价所需的语境知识,这也是实验室研究扩展到小型语言社群时无法跳过的一步。
参考文献
- Barr, Dale J., et al. “Random Effects Structure for Confirmatory Hypothesis Testing.” Journal of Memory and Language 68.3 (2013).
- Vasishth, Shravan, et al. “Statistical Methods for Linguistic Research.” In The Cambridge Handbook of Experimental Syntax, 2021.
- ManyBabies Consortium. “Quantifying Sources of Variability in Infancy Research.” Advances in Methods and Practices in Psychological Science 3.1 (2020). 项目
- Open Science Framework. “Registrations and Preregistrations.” 指南