跳转到内容
← 返回核心概念
安全与隐私计算机科学 · 数据与系统治理13 分钟阅读

隐私工程

Privacy Engineering

一个系统可以从未发生数据泄露,却仍然严重侵犯隐私:它可能收集完成任务不需要的数据,把用户预期中的单次用途变成长期画像,允许员工合法查询敏感记录,或用准确模型对人做不透明且不公平的决定。 隐私工程把隐私从政策口号变成可验证的系统属性。它追踪数据为何被收集、怎样关联、谁能推断什么、保留多久、个人能否理解和控制,以及处理活动…

隐私工程数据最小化差分隐私去标识化隐私风险

一个系统可以从未发生数据泄露,却仍然严重侵犯隐私:它可能收集完成任务不需要的数据,把用户预期中的单次用途变成长期画像,允许员工合法查询敏感记录,或用准确模型对人做不透明且不公平的决定。

隐私工程把隐私从政策口号变成可验证的系统属性。它追踪数据为何被收集、怎样关联、谁能推断什么、保留多久、个人能否理解和控制,以及处理活动可能给个人和群体造成什么后果。

破除误解:隐私不等于保密,也不等于删除姓名

信息安全主要保护机密性、完整性和可用性,常从攻击者、漏洞和组织资产出发。隐私风险则可以来自完全授权、按设计运行的数据处理,其首要影响对象是个人和群体。

加密能阻止没有密钥的人读取数据,却不能限制拥有权限的服务把数据用于新目的;访问控制能阻止陌生人查询,却不能回答“这个字段本来是否应该收集”。

删除姓名也不自动匿名。位置轨迹、时间、职业、年龄、罕见诊断和公开资料可以组合成准标识符。假名化把直接标识替换为代码并分开保存映射,能降低部分风险,但只要组织仍可合理地重新关联,数据通常仍不是匿名数据。

风险模型:从数据动作到人的后果

NIST 把可能给个人造成不良后果的处理称为“问题性数据动作”。一个实用模型是:

隐私风险=问题性数据动作发生并造成问题的可能性×对个人或群体的影响\text{隐私风险} = \text{问题性数据动作发生并造成问题的可能性} \times \text{对个人或群体的影响}

影响不只包括经济损失和身份盗用,也包括监视感、污名、歧视、失去自主、错误拒绝服务、寒蝉效应和身体安全。相同字段在不同情境中风险不同:公开跑步路线可能只是社交内容,也可能暴露家庭地址、宗教活动或医疗状态。

威胁模型应包括:

  • 外部攻击者与数据经纪商;
  • 有合法访问权但目的越界的员工、合作方或模型训练团队;
  • 能用其他数据集做链接和推断的人;
  • 自动决策系统及其反馈循环;
  • 原本无恶意、却因默认设置或激励持续扩大收集的组织流程。

第一步:画出真实数据流

隐私评审不能只看数据库表。应为每类数据记录:

text
来源
→ 收集目的与界面
→ 设备/浏览器端处理
→ API 与日志
→ 主存储、备份和缓存
→ 分析、训练与第三方共享
→ 用户访问/更正/删除
→ 到期与可验证销毁
```

还要标明直接标识、准标识、敏感属性、推断属性、控制者、处理者、保留期、跨境或跨组织流动以及法律/合同依据。若团队无法回答某字段最终进入哪些日志和派生表,就无法兑现删除或用途限制。

数据清单必须覆盖派生物。模型 embedding、风险分数、聚类标签和“可能怀孕”等推断可能比原始点击更敏感;只删除原始记录而保留可关联派生物,未必实现预期结果。

三个工程目标:可预期、可管理、去关联

NISTIR 8062 提出三个互补目标:

  • 可预期性(Predictability):个人、系统所有者和运营者能对数据处理形成可靠预期;
  • 可管理性(Manageability):系统支持访问、更正、删除、选择性披露、保留和策略变更;
  • 去关联性(Disassociability):在业务不需要识别个人或设备时,处理不应继续维持关联。

“展示隐私政策”不等于可预期。如果说明含糊、在关键操作后才出现,或实际 SDK 行为与文案不同,用户仍无法形成可靠预期。控制按钮也不等于可管理;后台副本、导出文件和训练管线若不响应控制,界面只是装饰。

数据最小化:最先考虑不收集

最强的泄露控制是系统从未拥有那份数据。对每个字段问:

  1. 它服务哪个明确目标?
  2. 能否在设备端计算,只上传结果?
  3. 能否降低精度、缩短时间窗口或聚合后再收集?
  4. 能否用事件计数代替稳定用户标识?
  5. 目标结束后何时自动删除?
  6. 若不收集,哪些核心功能真的无法工作?

“未来可能有用”不是可测试需求。遥测可采用分层采样、短期原始日志、长期聚合指标;位置可按城市而非精确坐标;年龄可按满足业务的区间处理。最小化还会减少安全成本、合规范围和供应商依赖。

访问控制、用途限制与审计

最小权限需要同时约束主体、数据、动作、目的和时间。客服可能需要查看订单状态,却不需要完整支付信息;反欺诈模型可使用某些属性,但分析师不一定需要逐行导出。

目的限制不能只存在于文档。可将用途标签、数据分类、查询策略、审批和审计结合,在高风险导出时要求理由、到期时间或双人批准。检测“谁访问了什么”还不够,审计系统要发现异常批量查询、绕过接口和用途漂移。

日志本身也含隐私风险。为了可审计而永久记录全部查询参数,会创建新的敏感数据库。应对日志做字段白名单、令牌化、访问分层与保留限制。

去标识化:攻击模型决定结论

去标识化要说明发布模型:仅内部使用、向受约束研究者开放,还是公开下载。对手能获得的辅助数据、计算能力和动机会随模型变化。

常见风险包括:

  • 单独识别:记录具有独特组合;
  • 链接:可与另一数据集匹配;
  • 属性推断:即使不知道姓名,也能推断敏感属性;
  • 成员推断:判断某人是否出现在数据集或模型训练集。

假名化减少直接暴露,却需要隔离映射、密钥轮换和访问策略。k-匿名等方法关注等价类大小,但不能普遍抵抗同质性、背景知识和多次发布组合。匿名不是一次处理后的永久标签,应随辅助数据和攻击方法变化重新评估。

差分隐私:量化参与造成的额外泄露

差分隐私比较只相差一个个体记录的相邻数据集。随机机制 M 满足 (ε, δ)-差分隐私时,对任意输出集合 S

Pr[M(D)S]eεPr[M(D)S]+δ\Pr[M(D)\in S] \le e^\varepsilon \Pr[M(D')\in S] +\delta

直觉是:一个人是否参与,不应让输出分布发生过大变化。ε 越小通常隐私保证越强,δ 是允许保证失效的额外概率项,但二者必须结合相邻关系、数据规模、机制和攻击模型解释。

差分隐私不是“给数据随便加噪声”。工程实现需要:

  • 定义保护单位是事件、用户还是家庭;
  • 限制单个主体贡献,计算查询敏感度;
  • 选择机制并验证数值实现;
  • 管理多次查询的隐私预算组合;
  • 防止未计入预算的调试、缓存和侧输出;
  • 同时报告效用、偏差和对小群体统计的影响。

NIST SP 800-226 强调数学定义之外的实现风险。一个宣称使用差分隐私的产品,若不公开相邻关系、ε/δ、组合方式和贡献界限,外界无法评价实际保证。

其他隐私增强技术及其边界

  • 端到端加密保护通信内容,但通信双方、时间、大小和关系等元数据可能仍可见;
  • 安全多方计算允许多方联合计算而少暴露输入,但协议、输出泄露和参与方串通模型必须明确;
  • 同态加密可在密文上计算,代价、支持操作和密钥治理决定可用性;
  • 可信执行环境隔离运行时,但仍依赖硬件、远程证明、供应链和侧信道;
  • 联邦学习减少集中原始数据的需要,却不会自动防止梯度泄露、恶意客户端或中心方推断;
  • 本地处理减少传输,但应用更新、遥测和云备份可能重新引入数据流。

技术名称不能替代端到端威胁模型。多种技术组合后还要检查接口处是否重新出现明文、稳定标识或未预算输出。

从设计评审到持续验证

一套可执行流程是:

  1. 明确功能目标、受影响人群和不可接受后果;
  2. 建数据流与处理目的清单,包括派生数据;
  3. 枚举问题性数据动作、对手和授权滥用;
  4. 估计可能性、影响及分布是否集中于脆弱群体;
  5. 优先删除数据或缩小精度、范围和保留期;
  6. 选择访问、加密、去关联、审计和用户控制;
  7. 用攻击演练、删除追踪、策略测试和差分隐私审计验证;
  8. 当用途、供应商、模型或辅助数据变化时重新评估。

指标应连接到结果,而不是只统计“完成多少隐私培训”。更有意义的指标包括超期数据比例、删除请求在全部副本完成的时延、未登记数据流、异常导出、权限审查覆盖、再识别测试结果和隐私预算消耗。

法律、伦理与工程边界

法律给出权利、义务和地区边界,工程将其转化为系统能力;两者不能互相替代。不同法域对个人数据、匿名、同意、敏感数据和自动决策有不同定义。本文不提供法律意见,具体系统需要法律、产品、安全、研究和受影响群体共同参与。

合规也只是最低线。某项处理即使存在法律基础,仍可能不可预期、操纵性强或把风险集中在缺乏选择权的人群。隐私工程最终要回答:系统获得的组织价值,与个人承担的识别、失控和不公平风险是否相称。

跨域连接

  • 生命权力:隐私风险可以来自完全授权、按设计运行的处理,这正是福柯式权力的运作方式——不必违法,通过分类、评分与可见性即可生效。全景敞视的关键也不是被观看,而是不确定是否被观看所引发的自我约束。推论是寒蝉效应属于可测量的行为改变,应当作风险后果的一项指标,而不是主观抱怨。
  • 概率论:差分隐私约束的是相邻数据集上输出分布的比值,因此它保证的是任何后处理都无法把某人是否参与区分开,且多次查询的泄露可以按预算累加。这立刻给出可核查的清单:不公开相邻关系、参数取值、贡献上界与组合方式,外界就无法评估实际保证——「用了差分隐私」本身不构成任何承诺。
  • 基因检测与隐私:基因数据同时是关于亲属的信息,于是以个人为单位的同意在结构上失效:一个人的授权会牵连从未同意的人,而再识别可以通过族谱数据库完成,即使样本本身已去标识。推论具有一般性——凡带群体外部性的数据类型,个人同意都不足以覆盖风险,必须用用途限制与发布模型来补。
  • 调查研究:统计披露控制早就面对同一难题:单张汇总表看着无害,几张相关表交叉就能定位到个人。等价类大小这类思路正是这一传统的延续,其失效模式——同质性、背景知识、多次发布叠加——也早被记录在案。推论很实用:任何持续发布相关结果的系统都必须按累积泄露评估,逐次评估必然低估。
  • 机器学习概览:模型会记住训练数据,成员推断能判断某人是否在训练集中,嵌入向量与风险分数这类派生物有时比原始点击更敏感。推论直接冲击合规承诺:如果删除只覆盖原始记录而不覆盖模型与派生表,法律意义上的已删除就与事实上的可推断性分叉,而后者才是个人真正承担的风险。

参考文献

  • NIST. Privacy Framework: A Tool for Improving Privacy through Enterprise Risk Management, Version 1.0. 2020.
  • NIST. An Introduction to Privacy Engineering and Risk Management in Federal Information Systems. NISTIR 8062, 2017.
  • NIST. Guidelines for Evaluating Differential Privacy Guarantees. SP 800-226, 2025.
  • Dwork, C. & Roth, A. The Algorithmic Foundations of Differential Privacy. Foundations and Trends in Theoretical Computer Science, 2014.
  • UK Information Commissioner's Office. Anonymisation and Pseudonymisation Guidance. 2025–2026.
  • NIST. Digital Identity Guidelines: Federation and Assertions. SP 800-63C-4, 2025.

延伸阅读

  • NIST. Privacy Risk Assessment Methodology (PRAM).
  • Cavoukian, A. Privacy by Design: The 7 Foundational Principles.
  • Gürses, S., Troncoso, C. & Diaz, C. Engineering Privacy by Design. 2011.