跳转到内容
← 返回研究前沿
自主系统2024–20307 分钟阅读

具身人工智能的可靠性:机器人会说会看,为何仍不会收拾陌生厨房

Reliability for Embodied AI and Generalist Robots

视觉—语言模型让机器人能把“把桌上的杯子放进水槽”分解成动作,也能利用互联网图像和多机器人数据获得更广概念。但语言上的合理计划一旦落到物理世界,就必须面对摩擦、遮挡、软物体、脆弱器皿、传感延迟和人突然伸手。文本模型答错一句可以重试,机械臂判断错抓取点会打碎东西。具身人工智能的前沿因此不是让演示更像对话,而是让系统知道何…

具身人工智能机器人仿真到现实安全评测

视觉—语言模型让机器人能把“把桌上的杯子放进水槽”分解成动作,也能利用互联网图像和多机器人数据获得更广概念。但语言上的合理计划一旦落到物理世界,就必须面对摩擦、遮挡、软物体、脆弱器皿、传感延迟和人突然伸手。文本模型答错一句可以重试,机械臂判断错抓取点会打碎东西。具身人工智能的前沿因此不是让演示更像对话,而是让系统知道何时不知道,并在开放环境中安全降级。

2024 年《自然·机器智能》评论指出,生成式人工智能给机器人带来新方法,但感知、规划、抓取和人机互动距离复杂真实世界仍很远。当前成功多来自受控任务、精心选择的镜头与人工复位。真正通用性要在不同房间、光照、对象、机器人硬件和人类行为中保持性能,且失败成本可接受。

数据规模不能消除物理长尾

互联网数据包含大量语言和图像,却很少记录力、触觉、失败动作和精确控制。机器人轨迹昂贵,硬件差异又使数据难直接合并。跨机器人动作表示、遥操作、视频学习与仿真生成正在扩大数据,但“看见人拿杯子”不等于知道抓力、重量与滑移。未来数据集需要保存接触、力矩、失败原因和环境变化,而不是只存成功视频。

仿真可以低成本制造长尾场景,但仿真到现实差距不会靠更漂亮渲染自动消失。材质、摩擦和软体接触难精确建模。域随机化试图让策略在大量虚拟变化中学习稳健特征;系统辨识则用现实数据校准模型。有效性应由未见真实环境盲测证明,而不是在调过参数的实验台上比较。

从平均成功率转向风险包络

“成功率 90%”没有说明剩余 10% 是慢一点、掉落毛巾,还是碰伤人。安全评测应按后果分级,报告每小时危险失败、最小人员距离、碰撞能量、人工接管频率与恢复能力。任务越开放,越需要安全监控器独立于高层模型:限制速度和力、检查工作区、阻止越权动作,并在不确定时停下或求助。

不确定性也不只是模型输出一个概率。系统要区分没见过的对象、感知被遮挡、动作不可达、指令相互冲突和环境发生变化,并为每类不确定选择不同策略。仅用语言模型自我反思可能给出流畅却错误的解释;必须与传感残差、物理约束和外部验证结合。

人类在环不是无限资源

远程接管可让早期系统安全运行,也可能把风险和低薪监控工作隐藏起来。若一名操作员只能看一台机器,自动化经济性和扩展性有限;若同时监督多台,注意负担会产生新事故。研究应报告接管持续时间、响应窗口和操作员工作量。人类在环应被当作系统组件进行容量设计,而不是失败时的万能兜底。

开放问题

  • 跨实验室基准如何防止团队针对固定场景过拟合,并覆盖罕见高后果失败?
  • 视觉—语言—动作模型如何给出可校准的不确定性,而非语言式自信?
  • 新技能学习如何避免破坏旧技能与安全约束?
  • 家庭与医院中的隐私数据能否在设备端学习,同时支持事故调查?
  • 监管应认证固定模型版本,还是认证持续更新的训练、监测和回滚流程?

可检验里程碑应是长时间、跨地点、无人布置的运行记录,以及对所有接管和危险失败的公开分类。一次精彩演示说明能力存在,可靠工程必须说明能力在什么边界内持续存在。

事故之前的“近失事件”

真实部署早期事故少、样本稀疏,仅靠伤害统计无法快速改进。机器人应记录险些碰撞、抓取滑移、安全监控拦截、重复规划和人工纠正等近失事件,并用统一严重度与暴露时间归一化。视频和传感日志涉及家庭或患者隐私,可采用设备端筛选、短期原始保存和授权事故复盘。关键是让安全团队看见危险趋势,又不把生活空间变成永久监控档案。

更新治理也应像飞行软件而非普通应用。新模型先在回放和仿真中跑已知失败集,再进行受限影子测试、小比例上线和明确回滚;安全约束改变必须单独审核。持续学习若直接从用户纠正更新权重,会引入投毒和技能退化。可验证目标是每次版本发布都不增加关键失败率,且出现异常时能在规定时间内定位到数据、模型或硬件变化。

标准化测试场应包含可重复扰动:透明物、软包装、儿童突然进入、网络延迟和传感器部分失效。团队不仅报告是否完成任务,还要报告是否及时拒绝、求助和恢复。系统在未知场景停下并不等于失败;若拒绝率与危险率能被共同校准,才可比较“更勇敢”是否只是更冒险。

工程安全提示: 本文不构成机器人部署或改装指导。自主机械系统可能造成夹挤、碰撞、电气与网络安全风险,任何设计、训练、现场测试、维护和人机协作均须由持照专业人员按当地法规与功能安全标准执行。

跨域连接

  • 机器人系统 提供感知、规划、控制与执行器闭环。具身模型只占闭环一部分;若低层控制、标定和安全回路不可靠,高层语义能力反而会扩大可造成的错误范围。
  • 基础模型 解释规模化预训练与下游适配。机器人多出物理后果和闭环分布变化;可检验推论是,离线基准提升必须与真实长时运行相关,否则模型只学会了基准表面。
  • 控制与反馈 强调持续测量和纠偏。高层计划必须接受状态反馈,不能像一次性文本生成;安全监控器则像独立的硬约束控制层,在语义模型失误时限制能量与空间。
  • 程序正义 提醒事故责任不仅由最终操作者承担。模型供应商、数据提供者、集成商和部署机构分掌不同控制权;透明接管记录与申诉机制会决定受影响者能否追责。

参考文献

  • Will generative AI transform robotics? Nature Machine Intelligence 6, 579 (2024). DOI: 10.1038/s42256-024-00862-2.
  • Brohan, A. et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. CoRL 2023. DOI: 10.48550/arXiv.2307.15818.
  • O’Neill, A. et al. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. ICRA 2024. DOI: 10.1109/ICRA57147.2024.10611477.
  • ISO. ISO 10218-1:2025 Robots and robotic devices — Safety requirements for industrial robots. 2025.

延伸阅读

  • NIST. Agility Performance of Robotic Systems. ongoing measurement science program.