破除误解
内容分析不是“读几篇文章后谈感想”,也不是把关键词出现次数直接当成社会态度。它是一套系统研究文本、图像、声音和符号材料的方法。研究者要定义材料总体,抽样,确定分析单位,设计编码规则,训练编码者,检验可靠性,再解释模式。
它也不等于计算文本挖掘。人工编码的内容分析、定性话语分析、定量词频分析、主题模型和大型语料分析都可以研究内容,但它们的证据逻辑不同。内容分析的核心问题是:某种社会意义如何被符号化、重复、分类和传播。
第三个误解,是以为内容只是“表面话语”。媒体标题、政策文本、广告图像、教科书、社交媒体帖子、法院判决、企业年报和短视频脚本,都在定义什么被看见,什么被忽视,谁被归类为问题,谁被归类为正常。
研究对象
内容分析可以研究新闻、影视、教材、法律、政策文件、演讲、广告、社交媒体、评论区、论坛、组织文件、会议纪要、图片、表情包和弹幕。只要材料承载可记录的符号,就可能成为对象。
研究对象要和问题匹配。若问题是“媒体如何建构失业青年”,材料可能是新闻报道和评论节目。若问题是“政策如何定义家庭责任”,材料可能是法律条文、政策通知和地方执行手册。若问题是“平台如何塑造公共情绪”,材料可能是热榜、推荐标题、短视频评论和平台规则。
材料不是越多越好。大量材料如果没有清楚总体和抽样,反而会制造假精确。研究者必须说明:为什么选择这些平台、这些年份、这些关键词、这些栏目?遗漏了什么?
内容分析还要注意材料的生产制度。同一篇新闻不是单个记者自由表达的结果,它受到编辑规范、机构立场、采访资源、平台流量和法律风险影响。政策文本也不是抽象国家意志,而是部门博弈、专业语言、预算约束和执行压力的产物。理解材料如何生产,才能避免把文本当作透明窗口。
分析单位
内容分析首先要定义分析单位。单位可以是一篇文章、一段话、一个句子、一个标题、一张图片、一次镜头、一个账号、一个评论线程,也可以是一个政策文件中的条款。
单位定义会影响结果。研究“移民是否被犯罪化”时,以文章为单位可能统计有多少报道提到犯罪;以段落为单位可以看犯罪框架出现的位置;以人物为单位可以看移民被赋予哪些角色;以图片为单位可以看视觉符号如何制造威胁感。
单位越细,编码越精确,但成本越高,也更容易丢失上下文。单位越大,保留语境更多,但内部差异可能被抹平。方法设计需要在精度和意义之间取舍。
编码规则
编码是把材料中的意义转化为可比较类别。编码规则必须清楚到不同研究者可以相对一致地使用。 “负面报道”这样的类别太粗,因为负面可能指犯罪、贫困、道德失败、国家安全、疾病风险或文化冲突。
好的编码手册会定义每个类别,给出正例和反例,说明模糊情况如何处理。它还会记录层级关系。例如研究性别呈现,可以区分职业角色、家庭角色、身体描写、能力评价、情绪标签和责任归因。
编码不是把复杂文本压扁,而是把研究问题所需的维度稳定提取出来。研究者应保留原文链接和片段,避免编码表脱离材料。
信度与效度
内容分析常需要检验编码者间信度。如果两个训练过的编码者对同一材料经常给出不同分类,说明规则不清或概念不稳定。常用指标包括 Cohen's kappa、Krippendorff's alpha 等。
但信度高不等于效度高。两个编码者可以一致地使用一个错误分类。效度要求编码真的捕捉研究概念。例如用“女性出现次数”衡量性别平等可能太浅,因为女性可以频繁出现,却被固定在照护、消费或被拯救角色中。
内容分析需要同时问:我们是否稳定地测量?我们是否测到了想测的东西?
定量内容分析
定量内容分析适合研究分布和趋势。例如某类新闻框架在十年中是否增加,不同媒体对同一事件的归因是否不同,政策文件中“权利”与“责任”的语汇如何变化。
定量的优势是可比较、可复核、可视化。它能让研究者从单篇文本走向系统模式。但它也容易把意义简化为出现次数。一个词出现少,不代表不重要;一个词出现多,也不代表意义相同。
因此,定量内容分析最好与样本阅读结合。研究者要定期回到文本,检查数字背后是否有语义变化、讽刺用法、否定结构和语境差异。
定性内容分析与话语
定性内容分析更关注意义结构。它会问:文本如何定义问题?谁被赋予责任?哪些解决方案被认为合理?哪些身份被自然化?哪些声音被排除?
话语分析进一步关注语言与权力。政策把“贫困”称为“能力不足”还是“结构性剥夺”,会影响责任归属。媒体把抗议者称为“暴徒”“市民”“青年”还是“组织者”,会改变公众理解。
定性分析不意味着随意解释。研究者仍需系统比较材料,呈现反例,说明解释如何从文本证据中来。
图像与多模态内容
当代公共生活不只由文字构成。照片、短视频、封面、配乐、滤镜、弹幕、表情包和界面排序都在制造意义。内容分析需要处理多模态材料。
分析图像时,研究者可以关注人物位置、视角、光线、身体姿态、服装、空间、颜色、字幕和剪辑节奏。分析短视频时,还要关注平台模板、热门音乐、评论互动和推荐机制。
多模态材料的难点是单位划分和解释一致性。研究者需要更清楚的编码手册,也需要保留代表性材料,让读者看到解释如何建立。
数字平台中的内容分析
平台时代给内容分析带来新机会,也带来新陷阱。研究者可以收集大量帖子、评论和视频,但这些材料受算法推荐、审核规则、用户自我呈现和平台接口限制影响。
“热榜上的话题”不是自然民意,而是平台规则、媒体账号、用户互动、商业推广和审核机制共同生产的结果。评论区也不是公众整体,而是愿意发言、能被看见、没有被删除的一部分人。
因此,平台内容分析必须把平台机制写进方法说明。数据如何抓取?是否违反服务条款?删除内容如何处理?机器人和营销号如何识别?用户隐私如何保护?这些不是技术细节,而是证据边界。
平台材料还会随时间变化。一次截图、一次抓取和一个接口返回值,可能只是算法系统在某一刻给研究者看的结果。若研究问题涉及趋势,研究者应记录抓取时间、排序规则、登录状态、地理位置和关键词策略。否则,研究者以为自己在研究公共讨论,实际研究的是平台给某个账号呈现的局部切片。
与计算社会科学结合
计算方法可以扩展内容分析的规模。词向量、主题模型、监督分类、情感分析和大型语言模型可以帮助处理海量文本。但模型输出不是解释本身。研究者仍要定义概念、验证分类、检查偏差。
人工编码可以作为训练集和验证集,计算模型可以帮助发现模式和异常。最稳健的做法,是让机器扩大视野,让人工守住概念。
跨域连接
- 大语言模型:自动标注把内容分析的规模瓶颈从编码员工时移到了验证——模型可以标注百万条文本,而"标得对不对"仍须靠人工标注的基准集来估计。关键是模型的错误不是随机的:它在少数类别与非标准语体上系统性更差,因而总体准确率会掩盖对特定群体的系统性误判。
- 媒体与公共领域:议程设置与框架研究的经验基础几乎全部来自内容分析,而这一方法能确立的是媒体说了什么,不能确立受众想了什么。把内容分布直接读作影响,是这一领域最常见的推论跳跃;建立影响需要把内容数据与受众数据接起来。
- 史学方法之争:把历史文本编码统计,使长时段的观念变化第一次可被绘制(词频、主题、情感)。其风险是语义漂移:同一个词在两百年间指称的东西可能已经改变,因而时间序列的解释必须先确立词义的稳定性——这一步在多数"文化组学"研究中被跳过。
- 癔症:症状表现随时代变化,是文化如何塑造疾病表达最著名的论据,而它在方法上可被检验:症状谱与医学教科书、大众媒体描述的对应关系可以被编码统计。近年经社交媒体传播的抽动样症状群,为这条老命题提供了一次实时的检验机会。
- 测量等价与公平比较:编码者一致性高不等于编码类别切中了任何真实变量——两者需要不同的证据支持。这与心理测量中信度与效度的关系完全同构,而内容分析的报告惯例仍以一致性系数为主,这使效度问题长期缺乏系统讨论。
参考文献
- Krippendorff, Klaus. Content Analysis: An Introduction to Its Methodology. SAGE, 2019.
- Neuendorf, Kimberly A. The Content Analysis Guidebook. SAGE, 2017.
- Weber, Robert Philip. Basic Content Analysis. SAGE, 1990.
- Entman, Robert M. “Framing: Toward Clarification of a Fractured Paradigm.” Journal of Communication, 1993.
- Grimmer, Justin and Stewart, Brandon M. “Text as Data.” Political Analysis, 2013.
延伸阅读
- Fairclough, Norman. Critical Discourse Analysis. Longman, 1995.
- Rose, Gillian. Visual Methodologies. SAGE, 2016.