云计算有一个从第一天起就存在、却长期被默认接受的漏洞:你的数据在云上是加密的——除了它正在被使用的时候。
静态加密保护硬盘,传输加密保护网络,但计算必须在明文上进行。数据一旦进入内存被 CPU 处理,云厂商的管理程序、运维人员、以及任何拿到 root 的攻击者,原则上都能读到它。对多数业务这个风险可以接受,因为除此之外别无选择;对医疗数据、密钥材料、跨机构联合分析与受监管的模型推理,它是根本性的阻碍。
机密计算试图消除这个例外:让数据在使用中也保持加密与隔离,并且让使用者能够验证这一点——不是相信云厂商的承诺,而是验证芯片的签名。
破除误解:它保护什么,不保护什么
第一,可信执行环境(TEE)不是"更强的加密",而是"更小的信任基"。 它做的事是把一段计算圈进一个隔离域,让域外的一切——包括操作系统、管理程序、云平台的运维工具——无法读取或篡改域内的内存。加密只是实现手段(内存被 CPU 内的密钥透明加解密),真正的产品是信任边界的重新划线。
第二,信任并没有消失,只是被转移了。 你不再需要信任云厂商的运维流程,但你必须信任 CPU 制造商:信任它的硬件设计没有后门、微码没有缺陷、根签名密钥没有泄露。远程证明能证明的只有一件事——"这段代码运行在一颗声称是某型号的、由某厂商签名的芯片上"。它把一个组织信任问题换成了一个供应链信任问题,而后者的参与者更少、更可审计,但也更集中。
第三,它默认不防物理攻击。 主流 TEE 的威胁模型明确把具备物理访问能力的攻击者排除在外。这在云场景下是个合理假设(你信任数据中心的门禁),在边缘设备与被没收的服务器上则完全不成立。2025 年的一系列研究把这条假设的代价演示得非常直白(见下文)。
技术形态:从飞地到机密虚拟机
TEE 有两代形态,反映了两种截然不同的工程哲学。
第一代是"飞地"(enclave)模型,以 Intel SGX 为代表:应用被拆成可信部分与不可信部分,只有可信部分进入飞地。它的信任基极小——只有你自己那几千行代码——但代价惨重:程序必须为它重写,系统调用要跨边界代理,内存受限,性能开销大。多年实践证明,让开发者重构应用是一道跨不过去的门槛。
第二代是"机密虚拟机"模型,以 AMD SEV-SNP、Intel TDX 与 Arm CCA 为代表:整台虚拟机连同它的操作系统被圈进保护域,管理程序被移出信任基。应用不需要任何修改就能受益。代价是信任基膨胀回一整个客户机操作系统——攻击面大得多,但迁移成本近乎为零。产业几乎一边倒地选择了第二代,这是典型的"可用性压倒纯粹性"。
GPU 进入信任域是最近几年最实质的扩展。AI 推理的敏感数据最终要进显存,如果 GPU 不在保护域内,CPU 侧的机密性就是摆设。NVIDIA 自 Hopper 一代起支持机密计算模式:GPU 加入 CPU 的信任域,PCIe 总线上的传输被加密,显存受保护;Blackwell 一代进一步把多卡之间的 NVLink 流量也纳入加密。厂商公布的推理吞吐开销在个位数百分比量级——这个数字很关键,因为如果开销是两倍,这项技术就不会有人用。
远程证明:整套体系的支点
没有证明,机密计算只是一个营销标签。
远程证明(remote attestation)的逻辑是:芯片在启动隔离域时对其初始状态做度量(固件、镜像、配置的哈希),用只有芯片知道、由厂商背书的密钥签名,生成一份证据。远端的数据所有者验证这份证据,确认"运行的确实是我审计过的那份代码,且确实在真芯片的保护域内",然后——也只有在此之后——才把解密密钥交给它。
这个"证明通过才释放密钥"的模式,是机密计算所有实际用法的骨架:多方在不交出原始数据的前提下联合分析、云上处理受监管数据、把私钥交给一段可验证的代码使用。它把安全性从"合同与审计"变成了"密码学与可验证的度量"。
代价也很实在:证明链的复杂度极高(芯片证书、平台证书、厂商吊销状态、度量基线的管理),每次实例启动会引入以秒计的一次性开销,而验证方需要有能力判断一份度量值是否对应他真正想要的那份代码——这一步在实践中经常退化成"照抄厂商给的期望值",把可验证性重新变成了信任。
2025 年的当头一棒:物理攻击有多便宜
机密计算长期的软肋是侧信道。SGX 上演过一长串攻击史——从 Foreshadow 到 ÆPIC Leak 到 Downfall,多数源于 CPU 微架构的瞬态执行缺陷,每一次都靠微码补丁堵上。
2025 年的两项研究把攻击面从微架构推到了物理层,且价格低得令人不安:
- Battering RAM 用一个约五十美元的 DDR4 内存插入器(interposer),把受保护地址重定向到攻击者控制的位置,从而绕过 SGX 与 SEV-SNP 的保护;
- TEE.fail(佐治亚理工与普渡的团队)把同类思路推进到 DDR5 平台,用不到一千美元的设备攻破了较新的 Intel TDX 与 AMD SEV-SNP,包括在启用了密文隐藏(Ciphertext Hiding)的配置下,并成功提取了证明密钥。
提取证明密钥的后果尤其严重:它意味着攻击者可以伪造一份"我运行在真实可信环境中"的证据,而远端验证者无法分辨。这动摇的不是某一次计算的机密性,而是整个信任链的根。
厂商的回应基本一致:物理攻击不在威胁模型内。这个回应在技术上无可指摘,在实践上却把一个关键问题摆到了台面上——如果一项技术的核心卖点是"连云厂商都无法窥探你的数据",那么"我们不防御能碰到机器的人"这句话,究竟削弱了多少卖点?答案取决于你到底在防谁:防好奇的运维与外部入侵者,它依然有效;防拥有机房物理权限的对手(包括某些法律强制场景),它不成立。
代价与争议
信任集中在少数几家芯片厂商手里。 全球的机密计算信任根实际上收敛到 Intel、AMD、Arm 与 NVIDIA 的签名体系。这既是它可行的原因(少数可审计的实体),也是它最脆弱的地方——一次根密钥泄露或一个未公开的设计缺陷,波及面是全球性的。开源硬件与多根信任的方案在研究中,离生产还有距离。
与密码学方案的路线之争。 同态加密(FHE)与安全多方计算(MPC)不要求信任任何硬件,安全性来自数学;代价是性能开销仍以数量级计。机密计算快得多,但把安全性建立在硬件假设上。这是一个诚实的取舍,而不是谁更先进的问题:需要数十年保密期、或对手可能包括硬件供应商的场景,密码学方案不可替代;需要今天就跑起来的生产系统,TEE 是唯一现实选项。
合规叙事跑在技术前面。 "数据在使用中也被加密"很容易被写进销售材料与合规勾选框,而实际保护强度高度依赖配置、度量基线管理与是否真正做了证明验证。一个开启了 TEE 但从不验证证明的系统,安全性与不开没有区别——这类"仪式性合规"是当前最常见的实施缺陷。
边缘与端侧的威胁模型完全不同。 手机、车机、物联网设备天然处在潜在攻击者的物理控制之下,而这正是主流 TEE 明确不防御的场景。把云上的结论平移到端上,是一个常见且危险的推理错误。
未知的边界
- 内存总线插入器一类的物理攻击,是否存在可承受成本的防御(例如内存侧的完整性树与新鲜度保证)?还是必须依赖物理安全?
- 证明密钥被提取后,能否设计出可快速吊销与恢复的信任链,而不必更换硬件?
- GPU 与加速器进入信任域后,跨设备的一致证明与密钥管理如何标准化?多厂商异构环境目前几乎没有统一答案。
- 机密计算能否降低到能被独立第三方审计的复杂度?目前的证明链复杂到只有厂商自己能完整解释。
- 当 FHE 的性能持续改进,两条路线的分界会移动到哪里?是否存在两者组合的实用架构(用 TEE 加速,用密码学兜底)?
- 各国的数据主权与执法调取要求,与"连基础设施提供方都无法访问"的设计目标之间,会如何在法律上收敛?
跨域连接
- 计算机安全原则:机密计算是"最小化可信计算基"这条老原则的一次硬件化实践。它的成败完全由信任基的大小与可验证性决定——第一代飞地信任基极小却无人使用,第二代机密虚拟机信任基庞大却被广泛采用,这个对比本身就是安全工程最经典的取舍:一个没人用的安全方案提供零安全性。
- 隐私工程:TEE 提供的是"运行时机密性",而隐私需要的远不止于此——数据最小化、目的限定、可删除性、差分隐私意义上的输出保护,都在 TEE 的能力之外。一个在飞地里跑的模型仍然可以从输出中泄露训练数据。把机密计算当作隐私解决方案,是把机制误当成了目标。
- 云计算:云的商业模式建立在"把基础设施交给别人"之上,而这必然要求某种信任。机密计算是第一次尝试把这份信任从合同与审计转移到可验证的技术机制。它是否成功,将实质性影响哪些行业的哪些负载能够上云——这是一个技术设计直接决定市场边界的罕见案例。
- 密码学基础:同态加密与安全多方计算给出了不依赖硬件的另一条路,两者的对照极具教学价值:密码学方案的安全性可以被证明,硬件方案的安全性只能被测试。前者的开销写在复杂度里,后者的风险写在未知的实现缺陷里;工程选择往往取决于你更害怕哪一种不确定性。
- 分布式系统:远程证明本质上是一个分布式信任问题——多个互不信任的参与方,需要就"某段计算的状态"达成可验证的共识。它与拜占庭容错处理的是同一类困难的不同侧面:后者假设参与者可能作恶而用冗余对抗,前者假设执行环境可能作恶而用硬件根信任对抗。两条路径的组合,是保密多方计算系统的常见架构。
参考文献
- Confidential Computing Consortium. A Technical Analysis of Confidential Computing.(白皮书,含威胁模型定义)
- de Meulemeester, J. et al. Battering RAM: Low-Cost Interposer Attacks on Confidential Computing. 2025.
- TEE.fail: Breaking Trusted Execution Environments via DDR5 Memory Bus Interposition. Georgia Tech & Purdue, 2025(含 Intel/AMD 官方响应)。
- Intel. Security Announcement INTEL-2025-10-28-001 (TEE.fail). 2025 年 10 月 28 日。
- Costan, V. & Devadas, S. Intel SGX Explained. IACR ePrint 2016/086.
延伸阅读
- Van Bulck, J. et al. Foreshadow: Extracting the Keys to the Intel SGX Kingdom. USENIX Security 2018.
- AMD. SEV-SNP: Strengthening VM Isolation with Integrity Protection and More. 白皮书, 2020.
- Arm. Arm Confidential Compute Architecture (CCA) 软件栈与 Realm 管理规范。
- Gentry, C. A Fully Homomorphic Encryption Scheme. 博士论文, Stanford, 2009.(对照路线的起点)