news 2026/7/24 13:27:35

Anthropic 机器人实验:Agent 能力为何取决于接口抽象层

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Anthropic 机器人实验:Agent 能力为何取决于接口抽象层

谈机器人 Agent 时,开发团队很容易先问“该选哪个大模型”。Anthropic 7 月 9 日发布的机器人研究给出了一个更接近工程现实的答案:同一个模型看起来强不强,很大程度取决于它通过什么接口接触物理世界。让模型直接输出关节力矩、让它写控制器、让它监督预训练策略,测到的并不是同一种能力。

这项研究的价值不在于宣布通用机器人已经成熟。恰恰相反,它展示了当前系统的明显短板,也说明了为什么评测不能只盯模型名称和一次成功演示。对开发者更有用的结论是:模型、感知工具、策略层、实时控制和安全护栏必须作为一个整体评估。

研究是怎样测的

研究团队用 MuJoCo 模拟环境和一台真实 Unitree Go2 四足机器人,覆盖经典控制、运动与导航、机械臂操作三类任务。机器人形态包括 12 自由度的 Go2、29 自由度的 G1 人形机器人,以及固定底座的 7 自由度 Franka Panda 机械臂。

模型面对四种控制接口:直接输出低层动作、编写 Python 控制器、调用预训练策略并给出高层指令,以及自行训练强化学习策略。团队评测了多个 Claude 版本,也纳入 GPT、Gemini、Kimi 和 Qwen 等模型;多数“模型×实验设置”单元运行 35 次,LIBERO-40 操作任务使用 200 次试验,高层导航套件使用 100 次试验。

这套设计刻意把“模型能力”和“接口提供的能力”拆开。直接控制要求模型持续处理物理状态;代码控制把连续反应压缩为一个可执行控制器;策略监督则让预训练网络负责低层动作,语言模型只决定接受、修改还是拒绝建议。

关键结果:抽象层改变了能力上限

综合图中,Claude Mythos Preview 的 Embody 组合分数为 0.389,Opus 4 为 0.115。但更值得注意的不是排名,而是每根柱子内部的构成:代码控制、策略监督和训练监督贡献了很大一部分能力,直接控制并没有随模型代际稳定地同步增长。

在低层机械臂操作中,完整任务成功率仍然很低,研究给出的范围是 0% 到 5.5%。较新的模型更常做到“接近目标、发生接触、完成抓取”等中间步骤,但一次局部进展不能等同于端到端可靠执行。

把预训练视觉—语言—动作策略 MolmoAct 接入后,LIBERO-40 的结果发生了明显变化。VLA 单独运行的成功率约为 86%;加入语言模型监督后,图中较好的 Claude 组合达到 76%,另一些组合为 58% 或更低。也就是说,高层策略显著抬高了系统能力,但语言模型监督也可能因不必要地覆盖正确动作而带来损失。

工具的作用也并不均匀。深度图和分割图整体接近中性,简单的可查询光标却让 Mythos Preview 在 10 项操作子集上的成功率从 6% 提升到 32%。在四足导航中,告诉模型朝向的指南针也比多种复杂视觉叠加更稳定。工程含义很直接:增加信息量不一定有用,提供可校准、可定位的状态变量往往更关键。

推理更久,不等于控制更稳

研究没有发现“增加推理预算”能普遍改善机器人任务。在部分经典控制任务中,更高推理预算反而让新模型退步;在 Opus 的高层导航中,不同推理设置的差距也很小。作者推测,长推理带来的规划收益可能妨碍需要快速反馈的反应式动作。

实时性边界尤其重要。四足机器人的低层控制大约需要 83 Hz,而研究中的非推理模型调用只有约 0.2—0.4 Hz。为避免只测到 API 太慢,团队在许多仿真实验中暂停物理模拟器等待模型返回。因此,这些直接控制成绩更像“延迟大幅降低后的能力上限”,不能直接外推为今天即可安全部署的实时控制能力。

长上下文也不是稳定的补救方案。LIBERO-40 的上下文截断实验保留最初 10 轮和最近 12 轮或 6 轮,多数模型并未显著下降,个别模型甚至改善。研究者据此判断,当前模型更多依赖最近几步进行短期修正,而不是形成贯穿整段任务的可靠空间记忆。

面向开发者的六层架构

把这些结果转成工程方案,可以采用“语言模型不进入硬实时闭环”的六层设计:

层级主要职责必须保留的约束
任务契约层把自然语言目标变成对象、区域、时限和完成条件禁止操作对象与最大影响范围必须显式声明
感知适配层将图像、力传感器和位姿整理为可校准状态保留原始观测,标记时间戳与不确定性
LLM 决策层选择子目标,判断策略建议是否可信只输出高层意图,不直接驱动电机
策略执行层用经过验证的控制器完成实时动作动作范围、速度和力限制由策略层强制执行
独立安全层做碰撞、越界、超时和急停判断不依赖同一个语言模型自我批准
观测与恢复层记录输入、建议、决策、结果和失败原因支持停止、复位、人工接管与可追溯回放

这个分层把“会不会做”与“允不允许做”分开。预训练策略可以提供稳定动作,语言模型可以处理不完整指令和异常判断,但物理边界由独立组件执行。即使模型错误理解一张图,系统也不应允许它越过速度、区域或对象白名单。

一个仓储分拣场景

假设机械臂要把指定料盒从检测区移动到返工区。输入不是一句“把有问题的都拿走”,而是一份任务契约:允许操作的料盒 ID、目标工位、最大夹持力、有效时间和人工确认条件。感知层同时返回相机画面、料盒位姿、夹爪力反馈与置信度。

预训练策略先提出抓取轨迹,LLM 只负责三种选择:接受、在允许范围内调整高层目标,或因观测冲突而拒绝执行。每次交接后,验证器检查“对象是否仍是白名单目标、轨迹是否越界、抓取后状态是否符合预期”。若连续两次验证失败、目标丢失或力反馈异常,系统立即停止并回到安全位,等待人工复核。

这个场景对应了研究里的核心发现:高层策略可能远强于直接控制,但监督者也可能错误覆盖本来正确的动作。因此日志必须同时保存“策略原建议”和“LLM 修改后建议”,上线指标也应分别统计接受率、错误覆盖率、人工接管率、越界拦截率和端到端成功率,而不是只看模型最终说了什么。

评测时至少问五个问题

第一,模型拿到的是原始像素、文本描述,还是带朝向和坐标的结构化状态?第二,低层动作由谁生成,频率是否满足物理闭环?第三,策略建议正确时,LLM 会不会频繁干预;策略建议错误时,它能否及时拒绝?第四,测试是否包含遮挡、漂移、反射、目标丢失和初始姿态变化?第五,失败后能否独立急停、复位并完整回放?

这五个问题比单一成功率更接近真实部署风险。Anthropic 的真实 Go2 试验中,模型曾把玻璃门里的目标倒影当成真实目标,也曾错误判断垃圾桶不在行进路径上。研究人员及时停止了机器人。这些案例说明,偶尔成功的演示不能替代异常场景和独立安全机制。

研究边界

这项研究仍有明确限制。大量结果来自仿真,真实机器人试验数量较少;直接控制实验暂停了模拟器,弱化了现实延迟;VLA 监督主要依赖一种预训练策略;提示模板没有针对各模型单独调优。部分新模型或预览模型的结果也不能代表所有部署环境。

此外,各控制接口的任务难度和可用信息不同,组合分数适合观察整体趋势,不适合当作通用机器人排行榜。模型代际与成绩变化是实验相关性,不证明某项训练改动造成了提升。开发团队应把论文结果当作评测设计线索,而不是产品可用性承诺。

结论

Anthropic 的实验提示了一条稳健的路线:让语言模型负责目标解释、异常判断和策略编排,让经过验证的控制器负责实时动作,再用独立安全层限制物理影响。模型升级当然重要,但接口抽象、可校准状态、权限边界和失败恢复同样决定系统能做什么。

当 Agent 开始影响真实设备时,最关键的问题不再只是“模型会不会”,而是“系统通过什么接口让它做、允许它做到哪里、失败后由谁立即停下”。这才是从演示走向可验证部署的分界线。

原文来源:Anthropic Research,《Claude plays robotics》,2026 年 7 月 9 日。https://www.anthropic.com/research/claude-plays-robotics

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/24 13:27:08

大模型在输变配电工程评审中的落地实践——金曲AI评审技术方案解析

在输变配电工程建设领域,传统人工评审模式存在流程繁琐、参数核对量大、规则适配性弱、人为误差率高等痛点。随着行业数字化转型推进,依托大语言模型赋能工程评审全流程,成为解决行业评审效率低、专业性参差不齐问题的关键方向。本文基于Deep…

作者头像 李华
网站建设 2026/7/24 13:26:27

AM572x GPMC异步接口时序深度解析:NOR/NAND Flash配置实战与避坑指南

1. 项目概述与GPMC核心价值 在嵌入式系统开发中,处理器与外部存储器的连接速度和可靠性,往往是决定系统性能上限和稳定性的关键。无论是需要快速执行代码的NOR Flash,还是用于大容量数据存储的NAND Flash,一个高效、灵活的内存控制…

作者头像 李华
网站建设 2026/7/24 13:26:05

深入解析SAR ADC典型特性:以ADS8584S为例的高精度数据采集设计指南

1. 项目概述:为什么我们需要深入理解一颗ADC的“典型特性”?在工业自动化、高端测试仪器或者精密医疗设备的设计中,我们常常会面对一个核心挑战:如何将现实世界中连续变化的物理信号(比如电机电流、传感器电压、生物电…

作者头像 李华
网站建设 2026/7/24 13:24:21

策略梯度方法:从理论到实践的强化学习核心

1. 课程内容概述博磊老师的强化学习纲要第四课下主要围绕策略梯度方法展开深入讲解。这部分内容是整个强化学习课程体系中的关键转折点,标志着我们从基于值函数的方法转向直接优化策略的方法。在实际工业应用中,策略梯度方法因其灵活性和对连续动作空间的…

作者头像 李华
网站建设 2026/7/24 13:23:32

Dev-C++安装配置全攻略:零基础搭建C/C++编程环境

1. 项目概述:为什么Dev-C依然是初学者的“老朋友”? 如果你刚刚踏入编程世界,尤其是C或C语言的大门,那么“Dev-C”这个名字你大概率不会陌生。它可能出现在你大学第一门编程课的推荐软件列表里,或者是你自己搜索“C语言…

作者头像 李华