跳转到内容
← 返回研究方法
计算方法方法论11 分钟阅读

计算社会科学

Computational Social Science

计算社会科学不是“社会学加一点 Python”,也不是把社交媒体数据抓下来画几张图。它是利用数字痕迹、大规模数据、计算模型和模拟方法研究社会行为、关系结构和制度过程的领域。它的关键不是数据大,而是能否提出社会科学问题,并用合适的计算证据回答。 第二个误解,是以为数据越大越接近真实社会。平台数据常常很大,却不一定代表总体…

计算社会科学数字痕迹平台数据仿真机器学习

破除误解

计算社会科学不是“社会学加一点 Python”,也不是把社交媒体数据抓下来画几张图。它是利用数字痕迹、大规模数据、计算模型和模拟方法研究社会行为、关系结构和制度过程的领域。它的关键不是数据大,而是能否提出社会科学问题,并用合适的计算证据回答。

第二个误解,是以为数据越大越接近真实社会。平台数据常常很大,却不一定代表总体。它记录的是被平台允许、鼓励、排序和保存的行为。没有账号的人、沉默的人、被删除的人、被算法压低的人、线下行动的人,都可能消失。

第三个误解,是把机器学习预测当成解释。模型能预测谁更可能点击、流失或转发,不等于解释了为什么。社会学需要把预测结果放回关系、制度、身份和权力中理解。

兴起背景

计算社会科学的兴起来自两个变化。第一,社会生活越来越多地经过数字系统:搜索、支付、定位、聊天、网购、短视频、外卖、网约车、政务平台、在线教育和电子病历都留下痕迹。第二,计算能力和算法工具让研究者能处理过去难以处理的规模和复杂性。

2009 年 Lazer 等人在 Science 发表“Computational Social Science”,把这一领域描述为利用大规模数据观察个人和群体行为的新机会。此后,计算社会科学进入网络分析、政治传播、城市研究、公共卫生、劳动研究、文本分析和平台治理。

但它不是从零出现。社会网络分析、计量社会学、仿真模型、内容分析和复杂系统研究早已为它提供基础。计算社会科学是这些传统在数字时代的重新组合。

数据来源

计算社会科学常用四类数据。

第一类是数字痕迹数据,例如点击、搜索、转发、评论、点赞、定位、购买、通话和平台接单记录。这类数据时间粒度高,规模大,但含义依赖平台设计。

第二类是文本和多媒体数据,例如新闻、政策、论坛、评论、短视频字幕、图像和弹幕。它们适合研究话语、情绪、框架和公共议题。

第三类是关系数据,例如关注、好友、通信、合作、交易、引用、共同出现和传播路径。它们连接社会网络分析和图算法。

第四类是行政与传感数据,例如教育记录、社保数据、交通刷卡、环境传感器和公共服务记录。这类数据接近制度运行,但隐私和治理风险更高。

可计算不等于可解释

平台记录的“行为”常需要重新解释。一次点赞可能表示支持、收藏、礼貌、讽刺或算法诱导;一次停留可能表示兴趣,也可能表示困惑;一次转发可能表示赞同,也可能表示批评。

因此,计算社会科学必须重视概念效度。研究者要问:这个数字痕迹是否真的代表我的概念?如果用搜索词衡量焦虑,用评论情绪衡量民意,用定位衡量社交活动,用好友数衡量社会资本,可能出现哪些偏差?

可计算性会诱导研究者选择容易测量的问题,而不是重要的问题。真正成熟的计算社会科学应让理论决定数据,而不是让接口决定理论。

网络、扩散与平台

网络分析是计算社会科学的核心。研究者可以研究信息如何传播,谣言如何扩散,社会运动如何动员,疾病如何沿接触网络传播,科学合作如何形成,平台推荐如何改变可见性。

但网络数据常是不完整的。平台上的关注关系不等于真实信任,转发关系不等于说服,好友关系不等于互助。研究者要区分可观察边和社会关系。

平台还会主动塑造网络。推荐算法、热榜、关注建议、封禁、限流和商业推广都会改变谁能看见谁。计算社会科学不能把平台当作中性场地,而要把平台作为制度对象。

文本即数据

大规模文本分析让研究者可以比较数百万篇文章、帖子或政策文本。主题模型可以发现议题结构,词向量可以研究语义变化,监督分类可以识别框架、仇恨言论、情绪或政策立场。

但文本模型需要验证。训练数据从哪里来?编码者是否一致?模型是否对少数群体语言更容易误判?讽刺、隐喻、方言、混合语言和语境转移如何处理?

大型语言模型进一步改变文本分析。它能辅助分类、摘要和抽取,但也可能制造幻觉、继承训练偏见、给出过度自信解释。社会学使用它时,应保留人工验证、透明提示和误差评估。

仿真与复杂系统

计算社会科学不只分析现成数据,也可以建立模拟。基于主体的模型让许多具有简单规则的行动者互动,观察宏观模式如何出现。谢林的隔离模型就是经典例子:即使个体只有轻微偏好,整体上也可能出现高度隔离。

仿真的价值不是准确预测每一个细节,而是探索机制。它能帮助研究者理解局部互动如何产生宏观结构,网络阈值如何影响扩散,规范如何稳定或崩溃,合作如何在重复互动中出现。

仿真也有风险。模型规则若过于任意,结果只是研究者假设的展开。好的仿真应清楚说明规则、参数、敏感性和经验校准。

因果与实验

数字平台让大规模实验更容易。平台可以随机改变信息展示、推荐顺序、默认选项或通知内容,观察行为变化。研究者也可以利用平台政策变化和算法调整做准实验。

但平台实验的伦理争议很大。用户是否知情?处理是否可能影响情绪、政治参与、就业机会或收入?平台是否有权在商业环境中大规模干预社会关系?研究者如何监督企业数据?

计算社会科学的因果研究必须把技术能力和公共责任放在一起。能随机化,不等于应该随机化。

隐私与数据治理

大规模社会数据常包含敏感信息。匿名化并不总是安全。位置轨迹、社交关系和少量特征组合,可能重新识别个人。数据泄露或误用会伤害真实的人。

研究者应遵守最小化原则:只收集回答问题所需的数据,只保留必要时间,只开放经过严格处理的结果。公开数据集也要评估再识别风险。

还有群体隐私问题。即使不识别个体,模型也可能把某个社区、族群、职业或疾病群体标记为高风险,导致歧视。计算社会科学必须从个人隐私扩展到群体伤害。

代表性与偏差

数字数据的偏差不是小问题,而是结构问题。谁使用平台,谁频繁发言,谁被算法推荐,谁被审核删除,谁能用标准语言表达,谁有稳定网络,这些都和阶层、年龄、地区、性别、族群、残障和政治环境有关。

研究者不能把“平台用户”偷换成“公众”。如果研究的是公共舆论,就要说明沉默者和离线者在哪里。如果研究的是劳动,就要说明平台之外的非正规劳动如何被遗漏。如果研究的是城市流动,就要说明没有智能手机或关闭定位的人如何被处理。

偏差并不意味着数据不能用,而是要求研究者清楚界定推论范围,并尽量用调查、访谈、田野和行政资料互相校正。

与传统方法的结合

计算社会科学最有价值的方向,是与传统社会学方法结合。访谈可以解释数字痕迹的意义,民族志可以观察平台如何进入日常劳动,调查可以校正样本偏差,实验可以测试机制,比较历史可以解释平台制度如何形成。

例如研究外卖骑手,平台数据可以显示订单、路线、时长和评分;民族志能看到等餐、抢单、交通风险和站点管理;访谈能解释骑手如何理解算法;统计模型能估计风险因素;政策文本分析能研究监管框架。单一数据源都不够。

跨域连接

  • 机器学习概览:预测与解释的目标冲突在此最尖锐——一个能高精度预测谁会辍学的模型,未必指出改变什么能减少辍学。把预测模型用于政策干预,等于假定相关是可干预的,而这一假定通常没有被检验,且失败时的代价由被预测者承担。
  • 调查研究:数字痕迹数据常被当作调查的替代品,而两者的偏差结构不同而非更小:调查的问题是谁不回答,痕迹数据的问题是谁不在平台上以及平台记录了什么。把两者结合的价值正在于偏差来源不重合,而不在于其中一个更真实。
  • 数字表型与计算伦理:可被推断的内容比被采集的数据敏感得多——移动模式可推断健康状态与社会关系。这使"去标识化"不足以保护隐私:风险来自推断能力而非标识符,因而治理必须落在用途与访问控制上。
  • 社会网络分析:平台数据使超大规模网络第一次可被观测,而它同时引入了一个结构性偏差:观察到的是平台上的关系,而非社会关系。两者的差距随人群而变(不同年龄、阶层的平台使用差异极大),因而网络结构的结论会系统性地偏向重度用户。
  • 可重复性危机与开放科学:这一领域的可重复性有一层额外困难——数据由平台控制、接口可随时关闭、历史快照无法重取。这意味着即使代码公开,研究也可能在原理上不可复现,而这一约束不是技术问题,是研究基础设施的所有权问题。

参考文献

  • Lazer, David et al. “Computational Social Science.” Science, 2009. DOI: 10.1126/science.1167742.
  • Salganik, Matthew J. Bit by Bit: Social Research in the Digital Age. Princeton University Press, 2018.
  • Grimmer, Justin and Stewart, Brandon M. “Text as Data.” Political Analysis, 2013.
  • Watts, Duncan J. Everything Is Obvious: Once You Know the Answer. Crown Business, 2011.
  • Kitchin, Rob. The Data Revolution. SAGE, 2014.

延伸阅读

  • Lazer, David et al. “Computational Social Science: Obstacles and Opportunities.” Science, 2020.
  • Edelmann, Achim et al. “Computational Social Science and Sociology.” Annual Review of Sociology, 2020.