概述
2026年,WAIC大会最热门的话题就是具身智能,草草粗略翻完《具身智能:从理论到实战》,以及网络资源,试图汇总梳理,加深印象。
具身智能,Embodied AI,智能体(Agent)的终极形态之一,拥有物理实体(如机器人、自动驾驶汽车),突破数字世界束缚,真正走入物理世界。目标让模型从看懂世界,走向能在世界里行动,再走向行动前能预判后果。
具身智能被广泛认为是实现通用人工智能(AGI)的关键路径,要求智能体在复杂物理世界中通过感知、推理与执行动作来完成长程任务。
概念
从感知理解到通用任务扩展的能力演进链:
| 概念 | 全称 | 主要解决什么问题 | 典型输入 | 典型输出 |
|---|---|---|---|---|
| VLM | Vision Language Model | 看懂图像/视频,并用语言表达 | 图像/视频+文本 | 描述、问答、检测结果、空间关系 |
| VLN | Vision Language Navigation | 根据语言指令在空间里走到目标 | 第一视角图像+路线指令 | 路径、航点、导航动作 |
| VA | Vision Action | 从视觉直接到动作 | 图像/视频+状态 | 轨迹、控制量、动作 |
| VLA | Vision-Language-Action | 按语言指令完成动作 | 图像/视频+语言+机器人状态 | 动作token、连续轨迹、action chunk |
| WM | World Model | 预测世界会怎样变化 | 当前状态+候选动作 | 未来状态、未来视频、奖励/风险 |
| WAM | World Action Model | 把动作和未来结果一起建模 | 视频/状态+目标/动作条件 | 未来变化+对应动作 |
| VLX | Vision-Language-X | 视觉语言模型向更多任务扩展 | 图像/视频+文本+X模态 | 导航、动作、定位、视频理解、控制等 |
VLM偏感知理解,VLN把视觉语言理解放进导航任务,VA和VLA开始输出动作,WM和WAM则进一步关注动作发生后世界会怎样变化。VLM、VLN、VLA、WM的使用相对稳定;VA更像本文对“视觉到动作”路线的归纳;VLX则用来指向视觉语言模型向更多具身任务扩展。
VLM
视觉语言模型,负责把图像、视频和语言放到同一个语义空间里理解。输入通常是图像或视频,再加上一段文本提示;输出可以是图像描述、视觉问答答案、目标位置、空间关系,或更结构化的检测结果。
价值:不只是给图像贴标签,还能理解物体、位置、关系和场景含义。
列举:CLIP、PaLM-E、Gemini Robotics
VLN
视觉语言导航,关注:智能体能不能一边看环境,一边按自然语言路线走到目标位置。
VLM让机器知道眼前有什么,VLN让机器知道该往哪里走。和VLM相比,VLN多“移动”和“停下”。VLM可能简单输出门在前方,VLN要进一步判断:现在该往哪里走,走到哪里转弯,什么时候停下来。
经典VLN任务里,智能体会拿到一条路线指令,然后在陌生环境中通过第一视角观察一步步移动。如Room-to-Room这类任务中,经常会出现类似指令:
上楼,穿过正前方的拱门,经过钢琴。当走廊尽头是画作和桌子时,向右转。在挂在墙上的麋鹿鹿角旁等待。这类指令难在:语言里的“上楼”“拱门”“钢琴”“右转”“等待”,都要和第一视角画面、当前位置、历史路径对上;模型还要记住自己走到了哪一步。
核心难点:
- 语言和视觉要对齐;
- 局部视野下判断方向;
- 长路线中的进度记忆;
- 环境变化后的重新规划。
拓展:Room-to-Room、Foundation Models for Embodied Navigation。
VA
不一定需要语言。模型看到图像、视频和当前状态后,直接预测动作、轨迹或控制量。
自动驾驶里的端到端驾驶策略(driving policy)就接近这条路线:摄像头看到道路、车辆、行人和车道线,模型直接输出未来轨迹、转向、加速度或刹车。
特点是链路短、延迟低,适合任务边界清楚、数据覆盖充分的实时控制问题。
局限也很直接:模型能输出动作,但不一定能解释依据;遇到训练里没覆盖的长尾场景,泛化和安全性都会变成问题。
不同论文可能会写成end-to-end policy、behavior cloning、diffusion policy或driving policy。
拓展:Diffusion Policy机器人动作策略
VLA
可说是最常见的概念。相比VA,VLA多了语言条件,语言让VLA能处理更开放的任务。
传统的机器人要么依赖于复杂的编程,要么受限于特定任务的强化学习,难以适应千变万化的现实世界。LLM和VLM的成功,催生VLA,这类模型旨在将视觉感知、语言理解和物理动作融为一体。
综述性论文,对应开源(GitHub,617 Star,31 Fork)库。
通用架构图
直观地展示VLA模型的核心工作流程:接收状态(State)(如摄像头捕捉的图像)和指令(Instruction)(如用户的语言命令)作为输入,通过视觉编码器和语言编码器进行处理,最终由动作解码器(Action Decoder)生成机器人需要执行的动作(Action)。整个系统还与强化学习、世界模型等重要相关技术紧密相连。
从单模态模型到VLA模型的发展时间线
- 单模态模型的奠基:
- CV:从ResNet、ViT到SAM,CV模型提供强大的视觉感知能力,让AI能看懂世界。
- NLP:从GRU、Transformer到BERT、ChatGPT,NLP模型让AI能听懂人类语言。
- RL:从DQN、AlphaGo到决策Transformer(DT),RL为AI提供从试错中学习最优策略的理论框架。
- 多模态模型兴起:
- VLM:以CLIP、LLaVA为代表,将视觉和语言两种模态对齐,实现看图说话、视觉问答等功能,为VLA的出现奠定基础。
- VLA模型的诞生与发展:
- 底层控制策略(Control Policy):早期工作如CLIPort将VLM的能力与机器人控制相结合。RT-1、VIMA等模型利用Transformer架构,将机器人控制问题转化为序列预测问题,极大提升模型泛化能力。
- 高层任务规划器(Task Planner):如SayCan、PaLM-E,利用LLM强大的推理能力,将复杂的长时程任务分解为一系列简单的子任务,指导底层控制器逐步执行。
- 概念正式提出:RT-2模型正式提出VLA术语。
视觉编码器的好坏直接决定VLA模型对环境的感知能力。一个好的PVRs能从输入的图像中提取出物体的类别、姿态、几何形状等关键信息。
常用的PVRs方法,如CLIP、R3M、MVP、DINOv2等。
视觉编码器类型,如ResNet、ViT
训练目标,如视觉-语言对比学习VL-CL、时间对比学习Time-CL、掩码自编码器MAE
CLIP:通过在海量图文对上进行对比学习,学习到强大的图文对齐能力,使其成为许多VLA模型的首选视觉编码器。
R3M和VIP:专注于从视频数据中学习,采用时间对比学习(Time-contrastive learning),核心思想:在同一段视频中,时间上相近的帧在表征空间中也应该相近,而时间上相远的帧则应该被推开。这使得模型能够学习到物体的动态变化和时间连贯性。
基于MVP和MAE方法:借鉴NLP中BERT的成功经验,采用掩码自编码(Masked Autoencoding) 的方式进行自监督学习。随机遮挡输入图像的一部分(patches),然后训练模型去重建被遮挡的内容。迫使模型学习到图像的底层结构和细节,对于需要精细操作的机器人任务尤其有用。
DINOv2和I-JEPA:最新的自监督学习方法,通过知识蒸馏等技术,在不依赖大规模标注数据的情况下学习到媲美甚至超越有监督学习的视觉表征,潜力巨大。
任务规划器主要分为两大类:
- 整体式规划器(Monolithic Planners):通常是端到端的大型多模态模型,如PaLM-E。直接接收视觉和语言输入,生成任务计划。能力强大,但训练和部署成本高昂。
- 模块化规划器(Modular Planners):更加灵活,将LLM和VLM等模块组合起来,无需大量重新训练。
模块化任务规划器的两种主流方法。
- 基于语言(Language-based):以自然语言作为不同模块间信息交换的通用语。物体检测模块将检测到的物体以文本形式告知LLM,LLM再根据这些信息生成下一步的自然语言指令。代表:Inner Monologue
- 基于代码(Code-based):利用LLM强大的代码生成能力。将感知和控制模块封装成API函数(如
detect_objects(),pick(obj))。LLM通过生成一段Python代码来调用这些API,从而完成任务规划。这种方法可控性强,易于调试。代表作:ProgPrompt和CaP
主要难点:
- 动作怎么表示:token、连续轨迹、扩散策略、flow matching都在被尝试
- 数据从哪里来:机器人动作轨迹要真实设备、遥操作和安全场地
- 跨本体怎么做:机械臂、夹爪、移动底盘、人形机器人动作空间差别很大
- 实时性和安全怎么保证:机器人不能慢慢想每一步,也不能只靠语言推理保证安全
VLA现在很受关注,但还远没有到一个模型解决所有机器人任务的程度。
π0.7
π0:https://www.physicalintelligence.company/blog/pi0
当前挑战:
- 安全第一:在物理世界中,安全是机器人应用的首要考量
- 数据集与基准:仍然缺乏覆盖多样化场景、任务和机器人的大规模、高质量数据集
- 模型泛化:如何训练出能够泛化到新物体、新环境、新任务的通用VLA基础模型,仍然是一个开放性问题
- 实时性:当前的大型VLA模型推理速度较慢,难以满足动态环境下的实时交互需求
- 长时程任务:现有的分层框架虽然实用,但增加了系统复杂性,容易出现故障
未来趋势:
- 更强的基础模型:构建规模更大、能力更强的VLA基础模型,类似NLP领域的GPT-4
- 多模态融合:不仅仅是视觉和语言,未来将融合触觉、听觉、力觉等更多模态的信息
- 高效的实时推理:研究模型压缩、量化、蒸馏等技术,在保证性能的同时提升模型的推理速度
- 更广阔的应用场景:从目前的家庭、工业场景,拓展到医疗(手术机器人)、特种服务(护理机器人)等更具挑战性的领域
数据集
汇总一些基准测试数据集:
BC-Z:
RT-1-Kitchen:
BridgeData V2:
V-JEPA 2:
OXE:Open X-Embodiment,通过聚合来自22种不同机器人的数据,达到百万级别的轨迹数量。
仿真环境
为了解决真实世界数据采集难的问题,许多研究者转向仿真环境。仿真环境可大规模、低成本地生成数据,并提供精确的评测指标,但也面临着Sim-to-Real Gap(仿真到现实的鸿沟)的挑战。
iGibson:
AI2-THOR:
RLBench:
CALVIN:
OpenVLA
https://openvla.github.io
使用视觉编码器接收图像,再用语言模型主干融合视觉和语言上下文,最后输出动作Token。
RT-2
https://robotics-transformer2.github.io
核心思路,把机器人动作离散成Token,让视觉语言模型直接学习输出动作;把互联网图文知识和机器人控制接起来。
WM
世界模型,要回答的问题:如果现在这样做,接下来会发生什么。
早期的经典论文Recurrent World Models Facilitate Policy Evolution,对应项目主页,类比认知科学中人脑的心智模型(mental model),提出的智能体模型包含三个组件:
- 视觉感知组件V:可将它所看到的画面压缩成一小段代码表示
- 记忆组件M:可根据历史信息预测未来的代码
- 控制器C:决策组件,根据视觉和记忆组件的表示来决定采取什么行动。
主要包含状态表征和预测模型,正好对应心智模型中的mental representations和mental simulation:
- 状态表征:环境提供高维观察作为输入,纵向
V->z将每个输入帧压缩成抽象表示(低维特征向量) - 预测模型:水平的
M->h->M->h是以序列方式预测下一个时刻的表征,用RNN实现
V、M、C与环境交互:
强化学习使AI能够随着时间的推移改进其决策。强化学习算法可分为
- 无模型(model-free):通过大量与环境交互的试验,来了解哪些行为在不同情况下是成功的
- 有模型(model-based):即世界模型,在基于世界模型的强化学习中,智能体首先学习一个关于环境的内嵌模型,从中学习行为决策并用于规划,从而提高在真实环境中的表现。世界模型可以从更少的交互中学习,促进离线数据的概括,支持前瞻性探索,并允许在多个任务中重用知识。
世界模型也可称为预测动力学模型,对于决策十分重要,核心任务是预测智能体特定的行动下,世界状态的变化,即尝试建模世界的状态转换函数。如果能获得准确的世界模型,就能在其中反复试错,找到现实最优决策。
综述性论文,对应开源(GitHub,339 Star,15 Fork)库。
提出一个以功能、时间建模和空间表示三个核心维度为中心的框架:
- 在功能层面:区分决策耦合模型与通用模型;
- 在时间层面:区分序列仿真与推理和全局差异预测;
- 在空间层面:涵盖从潜在特征到显式几何结构及神经场的多种表示方式。
为现有方法提供统一的组织结构,并整合标准化数据集与评估指标,有助于实现定量比较,为未来研究提供全景式且可操作的知识地图。
从数据与评估、计算效率、建模策略三个维度,全面探讨具身智能中世界模型面临的挑战和未来研究方向。
- 数据与评估
- 挑战:具身智能领域缺乏统一的大规模数据集,现有数据分散且特定于领域,限制模型的泛化能力。评估指标多关注像素保真度,忽视物理一致性和因果关系。
- 未来方向:需构建统一的多模态、跨域数据集,改进评估框架,全面评估物理一致性、因果推理和长时域动态。
- 计算效率
- 挑战:Transformer和扩散网络虽性能强大,但高推理成本与机器人实时控制需求冲突。传统方法虽高效,但在捕捉长期依赖性上有限。
- 未来方向:利用量化、剪枝和稀疏计算等技术优化模型架构,探索状态空间模型等新型时间方法,以提升实时效率和长期推理能力。
- 建模策略
- 挑战:世界模型在长时域时间动态和高效空间表示上存在困难,自回归设计与全局预测方法各有优缺点,时间和空间建模存在效率与表达力的权衡。
- 未来方向:结合自回归和全局预测方法,通过显式记忆或任务分解提高时间一致性。优化长距离推理和生成保真度,将时间和空间建模集成到统一架构中,平衡效率、保真度和交互性。
分类
多种分类方式
- 决策耦合,区分决策耦合和通用型世界模型。决策耦合模型是任务特定的,学习动态以优化特定的决策任务。通用型模型是任务无关的模拟器,专注于广泛的预测,从而实现对各种下游应用的泛化。
- 时间推理,区分两种不同的预测范式。序列仿真与推断模型以自回归的方式模拟动态过程,逐步展开未来状态。全局差异预测直接并行估计整个未来状态,虽然效率更高,但可能以降低时间一致性为代价。
- 空间表示,包括当前研究中用于建模空间状态的四种主要策略:
- 全局潜在向量:表示将复杂的世界状态编码为紧凑的向量,从而在物理设备上实现高效的实时计算
- Token特征序列:表示将世界状态建模为Token序列,重点在于捕捉Token之间的复杂空间、时间及跨模态依赖关系
- 空间潜在网格:表示通过利用几何先验(如鸟瞰图(BEV)特征或体素网格)将空间归纳偏置融入世界模型中
- 分解渲染表示:将三维场景分解为一组可学习的基元,例如三维高斯点阵(3DGS)或神经辐射场(NeRF),然后利用可微分渲染实现高保真度的新视角合成。
数据资源
为了满足具身智能的多样化需求,将数据资源分为四类:仿真平台、交互式基准、离线数据集和真实机器人平台。
仿真平台:为世界模型的训练和评估提供可控且可扩展的虚拟环境。
- MuJoCo:可定制的物理引擎,因其在机器人学和控制研究中对连杆系统及接触动力学的高效仿真而被广泛采用
- NVIDIA Isaac:端到端、基于GPU加速的仿真栈,包含Isaac Sim、Isaac Gym以及Isaac Lab。提供逼真的渲染效果和大规模强化学习能力
- CARLA:基于Unreal Engine的开源模拟器,用于城市自动驾驶,提供逼真的渲染、多样化的传感器以及闭环评估协议
- Habitat:高性能的具身智能模拟器,专注于逼真的三维室内导航
交互式基准:提供标准化的任务套件和协议,用于对世界模型进行可重复的闭环评估。
- DeepMind Control:DMC,基于MuJoCo的标准控制任务套件,为从状态或像素观测中学习的智能体提供统一的比较基础
- Atari:一套基于像素、离散动作的游戏合集,用于评估智能体性能。Atari100k 通过将交互限制在100k步内,专门评估样本效率
- Meta-World:用于多任务和元强化学习的基准,包含50种多样化的机器人操作任务,使用MuJoCo中的Sawyer机械臂,并遵循标准化的评估协议
- RLBench:提供100个模拟的桌面操作任务,具有稀疏奖励和丰富的多模态观测,旨在测试复杂技能和快速适应能力
- LIBERO:一个用于持续学习机器人操作的基准,提供130个程序生成的任务和人类示范,以评估样本高效性和持续学习能力
- nuPlan:一个自动驾驶规划基准,采用轻量级闭环模拟器和超过1500小时的真实世界驾驶日志来评估长时程性能
离线数据集:大规模预先收集的轨迹,消除交互式滚动采样,为世界模型的可复现评估和数据高效预训练提供基础
| 数据集名称 | 类型/领域 | 数据规模与内容描述 | 特点与用途 |
|---|---|---|---|
| RT-1 | 机器人操作 | 17个月收集,13台机器人,700+任务,13w条示范,语言+图像输入,11-DoF动作 | 支持语言指令与视觉感知的多模态机器人学习 |
| OpenX-Embodiment(OXE) | 跨形态机器人 | 21机构,60数据源,22种形态,527项技能,100万+轨迹,统一格式 | 支持跨机器人平台训练,提升模型泛化能力 |
| nuScenes | 自动驾驶(感知) | 1K场景(20s),波士顿+新加坡,6摄像头+5雷达+1激光雷达+GPS/IMU,23类3D标注,HDMap | 多模态融合、3D感知、长时程预测基准 |
| Waymo | 自动驾驶(感知) | 1,150场景(20s),10Hz,旧金山+凤凰城+山景城,5激光雷达+5摄像头,1,200万3D/2D标注 | 大规模真实场景,3D目标检测与轨迹预测 |
| Occ3D | 自动驾驶(占据预测) | Occ3D-nuScenes:4w帧,0.4m分辨率;Occ3D-Waymo:20w帧,0.05m分辨率 | 体素级占据标签,超越边界框的细粒度场景理解 |
| OpenDV | 自动驾驶(视频-文本) | 2,059小时,6,510万帧,YouTube+7公开数据集,40+国家,244城市,带命令与上下文标注 | 支持语言与动作条件下的视频预测与规划 |
| Something-Somethingv2 | 视频动作理解 | 220,847视频片段,174类,文本提示生成(如“将某物放入某物”),训练/验证/测试集划分明确 | 细粒度动作识别,强调时序推理与语言-动作对齐 |
| VideoMix22M | 自监督预训练 | 2,200万样本,来源:YT-Temporal-1B、HowTo100M、Kinetics、SSv2、ImageNet(转视频) | 用于视频自监督预训练,支持V-JEPA等模型训练 |
| HM3D(Habitat-Matterport3D) | 室内仿真(具身智能) | 1k室内场景,112,500m²可导航面积,面向Habitat平台,含元数据与资源包 | 支持大规模室内导航与具身AI研究,提升场景多样性与仿真真实性 |
现实世界中的机器人平台:为交互提供物理实现,支持闭环评估、高保真度的数据采集以及在真实环境约束下的S2R验证。
- Franka Emika:7-DoF协作机械臂,全关节内置扭矩传感器;支持1kHz力矩控制,专为精细力控与接触密集型任务设计;提供官方ROS包与Franka Control Interface,即插即用,是力控操作与操作学习研究的标配桌面平台。
- Unitree Go1:低成本小型四足机器人,12关节电机驱动,最高速度4.7 m/s;机载1.5 TFLOPS计算盒+全景深度相机,可高帧率感知;开放ROS/C++/Python SDK,已成为运动控制、步态学习和具身导航领域的事实标准平台。
- Unitree G1:轻量化人形机器人,全身43-DoF,膝关节峰值扭矩120 N·m;集成3D LiDAR、深度摄像头、可换电池与机载计算;支持ROS与多语言SDK,提供多模态感知与全身控制接口,为训练和评估具身世界模型提供可落地的实体测试环境。
指标
用于评估世界模型性能的指标,这些指标从像素预测质量、状态级理解到任务表现,涵盖了从低级信号保真度到高级目标达成的多个层面。
像素生成质量
Fréchet 初始化距离(FID):比较真实图像和生成图像在预训练模型特征空间中的分布,值越低表示分布越接近。
Fréchet 视频距离(FVD):扩展 FID 到视频,评估每帧质量及时间一致性,值越低表示外观和动态分布越接近。
结构相似性指数测量(SSIM):比较生成图像与参考图像的亮度、对比度和结构,值越接近 1 表示相似性越高。
峰值信噪比(PSNR):衡量重建图像与参考图像的像素级失真,值越高表示保真度越高。
学习感知图像块相似性(LPIPS):通过比较预训练网络的特征,衡量生成图像与参考图像的感知相似性,值越低表示相似性越高。
VBench:综合评估视频生成的多个维度,包括视频质量和条件一致性,提供细粒度的性能评估。
状态级理解
平均交并比(mIoU):评估语义分割的准确性,通过平均各类别的交并比来衡量,值越高表示场景理解越精确。
平均精度均值(mAP):评估检测和实例分割的准确性,通过平均每个类别的平均精度来衡量,值越高表示识别和定位越准确。
位移误差:评估关键点、物体中心和轨迹航点的空间精度,包括平均位移误差(ADE)和最终位移误差(FDE),值越低表示定位越准确。
查准距(CD):量化预测与真实情况之间的几何相似性,适用于表面、占用、鸟瞰视图和三维结构的评估,值越低表示相似性越高。
任务表现
成功率(SR):衡量在具身环境中完成任务的比例,值越高表示性能越好。
样本效率(SE):衡量达到目标性能所需的样本数量,值越低表示样本效率越高。
奖励:在强化学习中,衡量代理在时间步 t 的表现,通过累积奖励或平均回报来评估,值越高表示性能越好。
碰撞率:衡量在导航或自动驾驶中发生碰撞的比例,值越低表示安全性越高。
Dreamer:
Genie
NVIDIA Cosmos
官网
World Labs
官网,
正在开发一种能够理解三维物理世界的模型,本质上是对物体的物理特性、空间位置和功能的理解和模拟。
WAM
世界动作模型,WAM=VLA+WM,把动作生成和未来预测放进同一个模型里,不只学习动作是什么,还学习动作如何改变世界。
论文
VLX
VLX还不是一个完全统一的学术类别,更适合用来理解趋势:视觉语言能力正在继续外接到更多任务。
X不是固定答案
还可以是detection,甚至是更复杂的具身任务输出。
Omniverse,英伟达推出的Isaac仿真平台,可用于生成仿真数据。
Isaac Sim 3.0 平台,基于其强大的 GPU 算力及先进的仿真技术,赋予了机器人操控现实世界物体的能力,通过构建高度逼真的虚拟环境,让机器人能在其中反复训练并将技能迁移至现实。
谷歌DeepMind 的 RT-1 和 RT-2 模型,借助 Transformer 架构在序列处理上的优势,成功实现对真实机械臂的精准控制,大幅提升机械臂操作的灵活性与准确性。
微软则巧妙地将具身智能技术融入 Mesh 平台,利用混合现实技术,致力于构建沉浸式虚拟世界,让虚拟智能体与现实环境产生交互。
CloudRobo
华为云推出,整合数据合成、数据标注、模型开发、仿真验证、云边协同部署以及安全监管等端到端能力,提供具身多模态生成大模型、具身规划大模型、具身执行大模型三大核心模型,加速具身智能创新。面对具身智能领域机器人品类多、传感器类型多、接口协议多等挑战,华为云提出了机器人到云的联接协议R2C(Robot to Cloud),希望与机器人伙伴与行业组织共同打造R2C开放协议,让更多的机器人本体能够拥有高效安全的智能。