谈机器人 Agent 时,开发团队很容易先问“该选哪个大模型”。Anthropic 7 月 9 日发布的机器人研究给出了一个更接近工程现实的答案:同一个模型看起来强不强,很大程度取决于它通过什么接口接触物理世界。让模型直接输出关节力矩、让它写控制器、让它监督预训练策略,测到的并不是同一种能力。
这项研究的价值不在于宣布通用机器人已经成熟。恰恰相反,它展示了当前系统的明显短板,也说明了为什么评测不能只盯模型名称和一次成功演示。对开发者更有用的结论是:模型、感知工具、策略层、实时控制和安全护栏必须作为一个整体评估。
研究是怎样测的
研究团队用 MuJoCo 模拟环境和一台真实 Unitree Go2 四足机器人,覆盖经典控制、运动与导航、机械臂操作三类任务。机器人形态包括 12 自由度的 Go2、29 自由度的 G1 人形机器人,以及固定底座的 7 自由度 Franka Panda 机械臂。
模型面对四种控制接口:直接输出低层动作、编写 Python 控制器、调用预训练策略并给出高层指令,以及自行训练强化学习策略。团队评测了多个 Claude 版本,也纳入 GPT、Gemini、Kimi 和 Qwen 等模型;多数“模型×实验设置”单元运行 35 次,LIBERO-40 操作任务使用 200 次试验,高层导航套件使用 100 次试验。
这套设计刻意把“模型能力”和“接口提供的能力”拆开。直接控制要求模型持续处理物理状态;代码控制把连续反应压缩为一个可执行控制器;策略监督则让预训练网络负责低层动作,语言模型只决定接受、修改还是拒绝建议。
关键结果:抽象层改变了能力上限
综合图中,Claude Mythos Preview 的 Embody 组合分数为 0.389,Opus 4 为 0.115。但更值得注意的不是排名,而是每根柱子内部的构成:代码控制、策略监督和训练监督贡献了很大一部分能力,直接控制并没有随模型代际稳定地同步增长。
在低层机械臂操作中,完整任务成功率仍然很低,研究给出的范围是 0% 到 5.5%。较新的模型更常做到“接近目标、发生接触、完成抓取”等中间步骤,但一次局部进展不能等同于端到端可靠执行。
把预训练视觉—语言—动作策略 MolmoAct 接入后,LIBERO-40 的结果发生了明显变化。VLA 单独运行的成功率约为 86%;加入语言模型监督后,图中较好的 Claude 组合达到 76%,另一些组合为 58% 或更低。也就是说,高层策略显著抬高了系统能力,但语言模型监督也可能因不必要地覆盖正确动作而带来损失。
工具的作用也并不均匀。深度图和分割图整体接近中性,简单的可查询光标却让 Mythos Preview 在 10 项操作子集上的成功率从 6% 提升到 32%。在四足导航中,告诉模型朝向的指南针也比多种复杂视觉叠加更稳定。工程含义很直接:增加信息量不一定有用,提供可校准、可定位的状态变量往往更关键。
推理更久,不等于控制更稳
研究没有发现“增加推理预算”能普遍改善机器人任务。在部分经典控制任务中,更高推理预算反而让新模型退步;在 Opus 的高层导航中,不同推理设置的差距也很小。作者推测,长推理带来的规划收益可能妨碍需要快速反馈的反应式动作。
实时性边界尤其重要。四足机器人的低层控制大约需要 83 Hz,而研究中的非推理模型调用只有约 0.2—0.4 Hz。为避免只测到 API 太慢,团队在许多仿真实验中暂停物理模拟器等待模型返回。因此,这些直接控制成绩更像“延迟大幅降低后的能力上限”,不能直接外推为今天即可安全部署的实时控制能力。
长上下文也不是稳定的补救方案。LIBERO-40 的上下文截断实验保留最初 10 轮和最近 12 轮或 6 轮,多数模型并未显著下降,个别模型甚至改善。研究者据此判断,当前模型更多依赖最近几步进行短期修正,而不是形成贯穿整段任务的可靠空间记忆。
面向开发者的六层架构
把这些结果转成工程方案,可以采用“语言模型不进入硬实时闭环”的六层设计:
| 层级 | 主要职责 | 必须保留的约束 |
|---|---|---|
| 任务契约层 | 把自然语言目标变成对象、区域、时限和完成条件 | 禁止操作对象与最大影响范围必须显式声明 |
| 感知适配层 | 将图像、力传感器和位姿整理为可校准状态 | 保留原始观测,标记时间戳与不确定性 |
| LLM 决策层 | 选择子目标,判断策略建议是否可信 | 只输出高层意图,不直接驱动电机 |
| 策略执行层 | 用经过验证的控制器完成实时动作 | 动作范围、速度和力限制由策略层强制执行 |
| 独立安全层 | 做碰撞、越界、超时和急停判断 | 不依赖同一个语言模型自我批准 |
| 观测与恢复层 | 记录输入、建议、决策、结果和失败原因 | 支持停止、复位、人工接管与可追溯回放 |
这个分层把“会不会做”与“允不允许做”分开。预训练策略可以提供稳定动作,语言模型可以处理不完整指令和异常判断,但物理边界由独立组件执行。即使模型错误理解一张图,系统也不应允许它越过速度、区域或对象白名单。
一个仓储分拣场景
假设机械臂要把指定料盒从检测区移动到返工区。输入不是一句“把有问题的都拿走”,而是一份任务契约:允许操作的料盒 ID、目标工位、最大夹持力、有效时间和人工确认条件。感知层同时返回相机画面、料盒位姿、夹爪力反馈与置信度。
预训练策略先提出抓取轨迹,LLM 只负责三种选择:接受、在允许范围内调整高层目标,或因观测冲突而拒绝执行。每次交接后,验证器检查“对象是否仍是白名单目标、轨迹是否越界、抓取后状态是否符合预期”。若连续两次验证失败、目标丢失或力反馈异常,系统立即停止并回到安全位,等待人工复核。
这个场景对应了研究里的核心发现:高层策略可能远强于直接控制,但监督者也可能错误覆盖本来正确的动作。因此日志必须同时保存“策略原建议”和“LLM 修改后建议”,上线指标也应分别统计接受率、错误覆盖率、人工接管率、越界拦截率和端到端成功率,而不是只看模型最终说了什么。
评测时至少问五个问题
第一,模型拿到的是原始像素、文本描述,还是带朝向和坐标的结构化状态?第二,低层动作由谁生成,频率是否满足物理闭环?第三,策略建议正确时,LLM 会不会频繁干预;策略建议错误时,它能否及时拒绝?第四,测试是否包含遮挡、漂移、反射、目标丢失和初始姿态变化?第五,失败后能否独立急停、复位并完整回放?
这五个问题比单一成功率更接近真实部署风险。Anthropic 的真实 Go2 试验中,模型曾把玻璃门里的目标倒影当成真实目标,也曾错误判断垃圾桶不在行进路径上。研究人员及时停止了机器人。这些案例说明,偶尔成功的演示不能替代异常场景和独立安全机制。
研究边界
这项研究仍有明确限制。大量结果来自仿真,真实机器人试验数量较少;直接控制实验暂停了模拟器,弱化了现实延迟;VLA 监督主要依赖一种预训练策略;提示模板没有针对各模型单独调优。部分新模型或预览模型的结果也不能代表所有部署环境。
此外,各控制接口的任务难度和可用信息不同,组合分数适合观察整体趋势,不适合当作通用机器人排行榜。模型代际与成绩变化是实验相关性,不证明某项训练改动造成了提升。开发团队应把论文结果当作评测设计线索,而不是产品可用性承诺。
结论
Anthropic 的实验提示了一条稳健的路线:让语言模型负责目标解释、异常判断和策略编排,让经过验证的控制器负责实时动作,再用独立安全层限制物理影响。模型升级当然重要,但接口抽象、可校准状态、权限边界和失败恢复同样决定系统能做什么。
当 Agent 开始影响真实设备时,最关键的问题不再只是“模型会不会”,而是“系统通过什么接口让它做、允许它做到哪里、失败后由谁立即停下”。这才是从演示走向可验证部署的分界线。
原文来源:Anthropic Research,《Claude plays robotics》,2026 年 7 月 9 日。https://www.anthropic.com/research/claude-plays-robotics