news 2026/8/19 13:09:21

具身智能论文学习14:π0.5: a Vision-Language-Action Model with Open-World Generalizatio

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
具身智能论文学习14:π0.5: a Vision-Language-Action Model with Open-World Generalizatio

第一部分:基本收录情况

项目内容
论文全名π0.5​: a Vision-Language-Action Model with Open-World Generalization
中文译名《π0.5​:具有开放世界泛化能力的视觉—语言—动作模型》
模型读法Pi-oh-five,可译作“派零点五”
正式会议The 9th Conference on Robot Learning
会议简称CoRL 2025
论文类型Oral论文
会议时间2025年9月27日至30日
会议地点韩国首尔,COEX会展中心
正式论文集Proceedings of Machine Learning Research
PMLR卷号Volume 305
正式页码17—40
正式出版日期2025年10月7日
作者团队Physical Intelligence
arXiv编号arXiv:2504.16054
上传版本正式版本已经收入CoRL 2025论文集,是PMLR第305卷第17—40页的Oral论文
基础模型继承π0​,以PaliGemma类VLM为基础
视觉语言骨干SigLIP约400M+Gemma约2.6B
动作专家约300M参数
动作生成FAST离散动作预训练+Flow Matching连续动作后训练
移动机器人数据约400小时
移动数据环境数约100个家庭环境
控制频率50Hz
主要评估未参与训练的新厨房、新卧室和真实家庭

第二部分:解决的问题

(1)π0.5在π0的基础上的改进

π0​=预训练VLM+Action Expert+Flow Matching连续动作

而π0.5​继续解决:怎样让VLA进入完全没有参与训练的新家庭环境,完成长时程家务任务?​

它没有抛弃π0​的动作专家和Flow Matching,而是在π0​之上增加:

  1. 更多类型的异构训练数据;
  2. 离散FAST动作与连续Flow动作的混合训练;
  3. 模型内部的高层语义子任务预测;
  4. 针对陌生家庭环境的移动机器人后训练。

(2)离散动作与连续动作各有优势

离散FAST动作适合大规模预训练,训练效率高;但推理时需要自回归生成,难以满足实时连续控制。

Flow Matching适合生成连续动作块,但从训练初期就完全使用Flow Matching,计算效率和语言能力保持可能不如离散Token预训练。

所以核心逻辑是:FAST:负责“好训练”​ Flow Matching:负责“好推理、连续控制”

因此,π0.5​要把两者结合:Pre-training 用离散 FAST→Post-training/推理 加 Flow Matching​


第三部分:“开放世界泛化”

π₀.₅ 所说的Open-world generalization,并不是简单更换物体颜色、背景或桌面摆放,而是直接把机器人部署到训练阶段完全没有出现过的厨房和卧室中,面对新的房间布局、物体实例甚至未见物体类别,并完成多阶段家庭操作任务。论文中的真实家庭任务通常持续2–5 分钟,完整清理厨房或卧室的演示可达到10–15 分钟

需要注意的是,新环境并不意味着所有底层技能都是全新的。抓取、放置、整理衣物等操作往往已经在其他环境或其他机器人数据中出现过;π₀.₅ 真正要泛化的是:如何在新的场景、物体和任务组合中识别当前情况,并把已有技能重新组合成正确的长时程行为。

Figure 2直观展示了 π₀.₅ 的开放世界泛化能力:机器人被直接部署到一个训练阶段从未出现过的新厨房,仅根据“关闭橱柜”“把物品放入抽屉”“擦掉污渍”“把餐具放入水槽”等高层指令,就能够完成多阶段家务任务。在执行过程中,π₀.₅ 会先根据当前场景预测下一项语义子任务,再由低层 Action Expert 生成对应的连续动作,因此既能在陌生环境中决定“下一步做什么”,又能实际完成精细操作。

核心不是“π₀.₅ 会分层控制”,而是“分层推理 + 异构数据训练使它能把已有技能重新组合起来,在完全陌生的真实场景中完成长时程任务”。


第四部分:π0.5​详细内容

(1)π₀.₅ 的核心训练与推理框架

π₀.₅ 的整体流程可以概括为:

异构数据预训练→移动机器人 Post-training→High-Level Subtask→Continuous Action Chunk

第一阶段是 Pre-training(先学“广泛能力”)。π₀.₅ 将移动机器人、其他机器人、高层子任务以及 Web 多模态数据等大量数据统一用于训练;其中机器人动作使用FAST 离散 Action Token表示,模型以标准自回归 next-token prediction 的方式学习文本、视觉语义和机器人动作

目的不是适配某一台机器人,而是先获得:

广泛的视觉语义、语言理解、机器人操作和跨环境泛化能力。

论文这一阶段训练 280k gradient steps。

第二阶段是 Post-training。模型进一步针对家庭移动操作进行适配,并加入随机初始化的Action Expert,使用 Flow Matching 学习连续 Action Chunk;同时继续保留 next-token prediction,以维持文本和高层语义预测能力。因此 π₀.₅ 实际结合了FAST 离散动作训练Flow Matching 连续动作生成两种表示。

同一份真实 Action Chunk,在 Post-training 时被做成了两种不同表示、两条并行训练支路

假设训练数据中的真实动作块是:
①第一条支路把它用 FAST 离散化:
然后 VLM 用自回归 next-token prediction 学:
这一支主要保留 π₀.₅ 的 token-based 训练能力。
②第二条支路则不经过 FAST,直接把同一个连续动作块加噪:

然后交给 Action Expert:(“速度/方向场”)

同时走两条训练支路:

最终 loss:

后训练结束后,π₀.₅ 确实同时学会了两套“动作表示/预测能力”FAST + AR:预测离散 Action Tokens​Action Expert + Flow Matching:生成连续 Action Chunk

π₀.₅ 的 Pre-training 是用大量异构机器人 + Web 数据学习通用能力;Post-training 用更贴近家庭移动操作的数据进一步专门化模型,加入 Flow Matching Action Expert让它能够输出实时连续动作

第三阶段推理时采用 High-Level → Low-Level 的两层过程。模型先根据当前观测和总体任务预测下一项语义子任务,例如从“clean the bedroom”得到“pick up the pillow”;随后再由 Action Expert 根据该子任务生成连续 Action Chunk。高层负责决定“接下来做什么”,低层负责决定“具体怎么动”。高层文本子任务使用 AR 生成,而低层机器人动作只通过 Flow Matching 生成连续 Action Chunk。训练时保留两种动作学习方式,部署时选择更适合实时控制的 Flow Matching。

Figure 1展示了π0.5​的整体研究思路。图左侧是非低层动作形式的多模态监督,包括高层子任务命令、物体检测数据以及图像描述、视觉问答和目标定位等Web多模态数据;图右侧则是机器人动作数据,包括真实家庭中的移动机器人、固定机器人、实验室机器人以及Open X-Embodiment等通用机器人数据。这些来源不同、标注形式不同的数据共同用于训练中间的π0.5​视觉—语言—动作策略。模型内部同时具备高层语义预测、低层动作控制和Action Expert,最终能够在没有出现在训练数据中的新家庭中直接部署,执行整理卧室、清理厨房等持续10—15分钟的多阶段任务。该图强调,π0.5​的核心突破并非单纯扩大目标机器人数据规模,而是通过异构数据之间的知识迁移获得环境、物体和任务层面的广泛泛化能力。


(2)π₀.₅的输入、输出与概率分解

模型输入包括:以及总体语言任务:

  • ​:不同摄像头图像;
  • :机器人本体状态;
  • :总体命令,例如“整理卧室”。

模型需要输出两类结果:

  1. 高层语义子任务
  2. 低层连续动作块​。

论文将联合分布写为(对完整推理过程的概率建模)

前半部分:表示根据总体任务和当前场景,决定下一项子任务。

后半部分:表示根据当前场景和子任务,生成具体动作。

例如:=“整理厨房”

模型先生成:=“拿起盘子”,然后生成双臂、底盘和升降机构的连续动作。

整体流程为:

(3)预训练VLM与Action Expert

π0.5​沿用π0​的专家结构:主体由预训练 VLM 和约 300M 参数的 Action Expert 组成。其中,VLM 由 SigLIP 视觉编码器和 Gemma 语言模型构成,负责处理图像、语言以及高层语义信息,例如场景理解、Web 视觉语言任务和子任务文本预测;Action Expert 则专门处理机器人连续动作,用于在 Flow Matching 中根据当前观测、机器人状态和带噪动作预测动作流场。

两部分并不是完全独立的模型,而是在同一 Transformer 框架中通过注意力交换信息,同时针对文本、图像和连续动作采用不同的编码方式及专家参数。因此,VLM 更偏向于回答“场景是什么、下一步做什么”,Action Expert 则负责“具体怎么动”。

与 π₀ 不同的是,π₀.₅预训练阶段并不使用连续动作 Action Expert,而是先将机器人动作通过 FAST 转换为离散 Token,与语言和视觉任务一起进行自回归 next-token prediction;到了 Post-training 阶段,才加入随机初始化的 Action Expert,并通过 Flow Matching 学习连续 Action Chunk。这样既利用 FAST 提高大规模预训练效率,又保留 Flow Matching 在实际机器人控制中的连续、快速动作生成能力。


(4)联合损失细节

真实动作块记为:

随机噪声为:

在动作和噪声之间构造插值:

其中:

  • :接近纯噪声;
  • :接近真实动作。

按照论文采用的时间方向约定,Action Expert学习预测:对应的速度场。

联合损失可以简化写成:

其中:,这里的是交叉熵损失函数。后训练中:

推理时先自回归输出子任务文本,再在该子任务条件下执行10次Flow去噪或积分,得到连续动作块。


(5)两阶段训练的具体配置

第一阶段:预训练

第一阶段为 Pre-training,共训练 280k 个 gradient steps。π₀.₅ 在大规模异构数据上进行统一的 next-token prediction,包括普通文本、高层子任务、目标框以及经过 FAST 编码的离散动作 Token,使模型先获得较广泛的视觉、语言、语义决策和机器人动作表示能力。

预训练阶段以SigLIP约400M参数的视觉编码器和Gemma约2.6B参数的语言模型组成预训练VLM,并将语言子任务、FAST离散动作、开放词汇图像描述和目标框统一表示为Token,通过不同的任务提示进行自回归下一Token预测。

第二阶段:后训练

第二阶段为 Post-training,共继续训练 80k steps,并加入随机初始化的 Action Expert。这一阶段重点面向家庭移动操作进行专门化,同时联合保留 next-token prediction 和 Flow Matching,以学习连续 Action Chunk。论文中 Flow Matching loss 的权重设为 α=10,并对机器人数据筛选成功且长度低于阈值的轨迹。

后训练阶段在预训练VLA基础上加入约300M参数的Action Expert:模型首先根据“整理卧室”等高层指令生成“拿起枕头”等语义子任务,再将该子任务作为低层命令输入动作专家,由动作专家从噪声开始通过Flow Matching生成连续动作序列。因此,π0.5​实现了“离散Token负责高效规模化预训练,连续Flow动作负责实时精细控制”的混合训练路线。

(6)六种异构数据来源

Figure 4 展示了 π₀.₅ 使用的六类数据来源:MM(移动机器人多环境数据)、ME(多环境固定机器人数据)、CE(实验室跨具身数据)、HL(高层语义子任务)、WD(Web 多模态数据)以及 VI(口头语言示范)。其中,机器人数据主要提供可迁移的操作技能和不同环境经验;HL 与 VI 用于学习“下一步做什么”的高层子任务决策;WD 则补充开放词汇、物体语义和视觉理解能力。

缩写数据类型主要作用
MM移动机器人多环境数据学习目标移动平台和家庭任务
ME固定机器人多环境数据增加真实家庭场景多样性
CE实验室跨具身数据增加任务与机器人技能多样性
HL高层语义子任务数据学习任务分解和下一步决策
WD多模态Web数据学习物体语义和开放词汇知识
VI人类口头指令示范学习适合低层策略执行的子任务命令

训练阶段对这些数据的使用并不完全相同。Pre-training联合使用 MM、ME、CE、HL 和 WD,以尽可能扩大机器人具身、环境和语义知识的覆盖范围;Post-training则更加聚焦家庭移动操作,保留 MM、ME、HL 和 WD,并新增 VI 数据,同时去掉实验室 CE 数据。目标是把预训练获得的广泛能力进一步专门化到真实家庭中的长时程移动操作。

(7)实验移动双臂平台与端到端动作控制

Figure 5 展示了实验使用的两种移动双臂机器人平台。两者均配备双 6-DoF 机械臂、平行夹爪、全向移动底盘、躯干升降机构以及 4 路 RGB 相机,整体状态与动作空间为 18 或 19 维。高层子任务推理使用前向、后向和两路腕部共 4 路图像,而低层动作控制主要使用前向和两路腕部图像。

控制端保持了较强的端到端特性:π₀.₅ 直接以50 Hz输出机械臂、夹爪、躯干和移动底盘的控制目标,并通过 Action Chunking 一次预测一段未来动作;底层仅使用简单 PD 控制器进行跟踪,没有额外加入轨迹规划或碰撞检测模块。

Figure 5展示了论文实验中使用的两种移动双臂机器人平台。两个平台均配备前向、后向和两个腕部摄像头,共四路RGB图像;机器人具有两条6自由度机械臂,每条机械臂还配备一个1自由度夹爪,底部采用3自由度全向移动底盘,并具有1—2自由度躯干升降机构。模型同时控制两条机械臂的关节或目标位姿、两个夹爪、底盘移动速度以及升降机构,使总状态和动作空间达到18或19维。高层推理可使用全部四路相机判断整体场景和下一子任务,低层控制则重点使用前向相机和腕部相机完成精细操作。


第五部分:实验效果

(1)实验设置与评价指标

①研究的5个问题

论文重点研究五个问题:

  1. 能否在全新的真实家庭中完成复杂任务?
  2. 泛化能力是否随训练环境数量增加而提高?
  3. 每一种协同训练数据到底有什么作用?
  4. 相比π0​提升来自哪里?
  5. 高层子任务推理是否真的必要?

②环境设置

包括:

  • 未参与训练的模拟厨房;
  • 未参与训练的模拟卧室;
  • 三个真实家庭中的厨房;
  • 三个真实家庭中的卧室。

模拟房间用于可控定量比较,真实家庭用于最终现实泛化验证。

③四项标准任务

Dishes in Sink:将4件餐具放入水槽,最高8分。

Items in Drawer:拿起物体、打开抽屉、放入物体、关上抽屉,最高4分。

Laundry in Basket:找到衣物、抓起并完全放入洗衣篮,最高3分。

Make the Bed:整理毯子并摆放两个枕头,最高5分。

指标是:完成步骤所获得分数占最高分的比例​

因此图中的80%通常表示平均完成了约80%的任务步骤,不一定表示80%的完整任务全部成功。

标准比较通常每项任务评估10次,四项任务合计约40次真实机器人rollout。

Figure 6展示了π0.5​的两类测试环境。左侧为专门搭建的模拟厨房和模拟卧室,用于在可控、可重复的条件下进行模型比较、数据规模实验和消融实验;右侧为真实家庭中的厨房和卧室,用于检验模型在真实布局、家具、光照、背景和物体变化下的最终泛化能力。所有这些测试环境均没有参与模型训练,因此实验考察的不是对已见场景的记忆,而是机器人能否将从其他家庭、其他机器人和Web数据中获得的知识迁移到新的空间和物体组合中。


(2)新家庭真实机器人实验

Figure 7 展示了 π₀.₅ 在训练阶段从未出现过的真实家庭中的执行结果。机器人只接收诸如“把物品放入抽屉”“把餐具放入水槽”“把衣物放入洗衣篮”这样的总体任务,随后自主预测“打开抽屉→拿起物体→放入抽屉→关闭抽屉”等高层子任务,并生成对应的低层连续动作。右侧结果显示,各任务平均进度约为65%~95%,与 Mock Environment 中的表现整体接近,说明π₀.₅ 能够把训练得到的视觉语义、高层决策和操作技能迁移到未见过的真实家庭。

Figure 7展示了π0.5​在三个未参与训练的真实家庭中的执行过程和定量结果。左侧依次给出了将物品放入抽屉、将餐具放入水槽以及将衣物放入洗衣篮的示例轨迹,蓝色文字表示模型在每个阶段预测的高层子任务,例如“拉开抽屉”“拿起夹子”“将夹子放入抽屉”和“关闭抽屉”。右侧柱状图报告每项任务在10次实验中的平均任务进度,真实家庭中的结果大致处于65%—95%之间,且与模拟家庭中约80%-90%的表现处于相近范围。这表明模型能够在新家庭中自主生成合理的子任务序列,并连续完成导航、抓取、放置和重复操作多个物体等多阶段行为


(3)环境数量与泛化能力

Figure 8研究训练地点数量对新环境任务泛化的影响。作者在基本保持训练样本量一致的情况下,将训练地点从3 个增加到 104 个,平均 Task Progress 总体由约14% 提升到 86%。虽然中间存在波动,但整体趋势表明:真正重要的不只是采集更多数据,而是让数据覆盖更多不同环境。当训练地点达到 104 个时,模型在未见测试家庭中的表现已经接近直接使用测试家庭数据训练的域内基线。

Figure 9进一步说明这种环境多样性也会提升语言和物体泛化。随着训练地点增加,无论是训练中出现过的物体类别还是未见过的新类别,Follow Rate 和 Success Rate 都总体提高;其中 OOD 物体提升更慢,说明“理解应该操作哪个新物体”与“真正成功完成抓取放置”仍存在差距。


(4)协同训练的贡献:数据消融与 π₀ 对比

Figure 10–11 对不同训练数据进行消融。在总体家庭操作任务中,移除 CE(实验室跨具身数据)或 ME(多环境机器人数据)都会使性能明显下降,同时移除二者下降最严重,说明来自不同机器人和环境的操作经验是物理技能泛化的重要来源相比之下,移除 WD(Web 数据)对总体 Task Progress 的影响并不显著,但在 OOD 物体的语言跟随与操作成功率上下降明显,说明Web 数据主要补充开放词汇和物体语义,而机器人数据主要提供“如何真正完成操作”的物理经验

Figure 10考察不同协同训练数据对新家庭总体任务表现的贡献。完整π0.5​在四项模拟家庭任务上的平均任务进度约为79%;移除Web数据后的结果约为72%,与完整模型的差异不具有统计显著性,p=0.385。然而,移除实验室跨具身数据CE后性能下降到约51%,移除多环境固定机器人数据ME后下降到约53%,同时移除CE和ME后进一步下降到约40%,三组差异均达到p<0.001。这说明,对整理床铺、餐具放置和抽屉操作等总体物理任务而言,来自其他机器人、其他环境和其他任务的动作经验是泛化的主要来源;Web数据的作用则更集中体现在未见物体识别和高层语义推理上。

Figure 11将数据消融进一步细分为域内和域外物体上的语言跟随率与操作成功率。对训练中出现过的物体类别,完整模型与移除Web数据的模型表现接近,说明常见物体可以主要通过机器人数据学习;但在未见物体类别上,完整模型的语言跟随率和成功率均约为94%,移除Web数据后分别下降到约80%和74%,表明Web数据提供的开放词汇物体知识对于识别新类别十分重要。移除CE或ME数据后,域内和域外的跟随率与成功率均明显下降;同时移除两类跨机器人数据时,域外成功率仅约33%。因此,Web数据主要补充“物体是什么、语言指的是谁”的语义知识,而跨具身机器人数据主要补充“识别目标后怎样可靠抓取和操作”的物理技能。

Figure 12 进一步与 π₀ 进行比较。仅采用FAST 离散动作训练 + Flow Matching 连续动作生成的 π₀-FAST+Flow 已明显优于原始 π₀,说明这种混合动作训练方式本身更加有效;但完整 π₀.₅ 在四项任务上仍保持最佳表现,说明其提升并不能只归因于 FAST+Flow,还来自高层语义监督、Web 知识以及异构机器人数据的协同训练。原始 π₀ 即使延长训练到 300k steps 仍未追上,也进一步体现了 FAST Token 预训练的训练效率优势。

Figure 12比较了完整π0.5​、π0​-FAST+Flow以及不同训练步数的原始π0​。完整π0.5​在餐具入水槽、物品入抽屉、衣物入洗衣篮和整理床铺四项任务上分别达到约91%、85%、80%和58%的平均任务进度,均为所有方法中最高。仅采用FAST离散预训练和Flow连续后训练、但不加入高层语义和Web数据的π0​-FAST+Flow已经明显优于原始π0​,说明混合动作训练本身有效;然而它仍在四项任务上落后于完整π0.5​,表明模型的进一步提升来自高层子任务、Web知识和完整异构数据协同训练,而不能只归因于动作表示的改变。原始π0​即使训练至300k步,整体仍显著低于两种FAST+Flow路线,也说明离散动作Token预训练具有更高的训练效率。


(5)高层推理消融

Figure 13 验证了高层语义信息对 π₀.₅ 的贡献。完整 π₀.₅ 同时进行高层子任务预测和低层动作生成,取得最佳表现;即使推理时取消显式子任务生成(Implicit HL),只要训练阶段仍使用高层子任务数据,性能依然保持较高,说明高层语义监督本身就能改善模型表示,而不仅仅是提供一个显式规划步骤。相反,完全去掉 HL、VI 或 WD 后性能均明显下降,表明高层子任务数据、语言示范和 Web 语义知识共同支撑了长时程决策。

此外,零样本 GPT-4 高层规划和 Human HL 都没有超过完整 π₀.₅。这里不应理解为“π₀.₅ 的规划能力超过人类”,更合理的结论是:高层子任务不仅要语义正确,还要与模型自身低层策略能够执行的技能和训练分布匹配。

Figure 13评估了高层语义子任务预测在π0.5​中的作用。完整模型同时使用高层和低层推理,平均任务进度约为79%,取得最佳结果。Implicit HL在训练中保留高层子任务数据,但推理时不显式生成子任务,仍达到约71%,与完整模型的差异为p=0.144,未达到统计显著水平;这说明高层语义监督即使不在推理时显式输出,也能够改善模型内部表示。相比之下,完全移除高层数据、移除口头指令VI或移除Web数据后,性能均下降到约60%左右。使用零样本GPT-4作为外部高层规划器仅达到约58%,人类提供子任务约为63%,均低于完整模型,说明高层命令不仅要语义合理,还必须与低层策略的训练分布和可执行技能相匹配。


第六部分:论文的主要创新和局限性

(1)主要创新

创新1:将FAST离散预训练与Flow连续后训练结合

FAST负责高效规模化+Flow负责实时连续控制

创新2:同一个VLA完成高层与低层推理

不再必须使用两个完全独立的模型,而是同一模型先输出语义子任务,再输出连续动作。

创新3:系统验证跨机器人知识迁移

其他固定机器人和实验室机器人数据显著提高了目标移动机器人在陌生家庭中的表现。

创新4:评估真正未参与训练的真实家庭

相比只更换桌面物体或背景,该实验包含新厨房、新卧室、新家具和多分钟长时程任务。


(2)主要局限性

① 高层语义推理High-Level reasoning 仍然会跑偏

例如机器人在收东西时,可能:

比如总体任务是:“把桌上的东西都收进抽屉”

理想的高层子任务应该是:打开抽屉→拿物体→放入抽屉→继续拿下一个物体→最后关抽屉

但 π₀.₅ 有时可能变成:打开抽屉→放东西→关抽屉​→又打开抽屉​→继续放东西

也就是说,它每次都能根据当前画面预测一个“看起来合理”的下一步,但整个长任务的全局进度管理还不够稳定论文原话就是:高层 subtask inference 有时容易被干扰,例如在收纳物品时会反复关闭和打开抽屉。

说明 高层子任务策略 high-level subtask policy 还没有真正稳定的长时程状态管理。


② 部分可观测性 Partial observability 仍然很难

例如机械臂挡住 spill 后:

模型可能“忘了”那里还有东西需要擦。

论文明确把 partial observability 作为问题。


③ 上下文 / 记忆 Context / Memory 还很弱

论文自己明确说:

模型 context 比较有限;加入更丰富的上下文信息 richer context 和 记忆 memory,可能让它处理跨房间导航、记住物体存放位置等任务。

例如:

去厨房拿杯子 ↓ 走到卧室 ↓ 回来 ↓ “刚才杯子在哪里?”

这种任务需要:Memory​

而不仅仅是: Current Observation​


④ Prompt 仍比较简单

论文也明确承认,π0.5 当前处理的 prompt 相对简单,更复杂的用户偏好和指令仍需要更丰富的 annotation。

(3)π0.5 → GR00T N1

π₀.₅ 主要研究“机器人到了陌生环境还能不能完成任务”;下一篇 GR00T N1 则进一步研究“如何让更复杂的人形机器人通过一个通用模型学习和执行多种任务”。

  • π₀.₅ 关心的是:机器人换了一个没见过的地方,还会不会干活?
  • GR00T N1 关心的是:能不能让更复杂的人形机器人,用一个通用模型学会很多种任务?

比如 π₀.₅ 研究的是:

机器人以前没见过这个厨房,但还能不能完成“把盘子放进水槽、整理房间”?

重点是:环境变了,机器人还能不能泛化​

而 GR00T N1 这句话想表达的是:

不只考虑机械臂或移动双臂机器人,而是考虑有手臂、腿、躯干等更多自由度的人形机器人,希望一个模型能够控制这种更复杂的身体去完成很多不同任务。

重点变成:机器人身体更复杂,任务更多,模型还能不能通用​

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/19 13:05:43

东芝2010ac彩色复印机报CA00故障

故障代码如上图显示一样,那么,这个是一个什么问题呢? 这个一般是效果有问题就会报这个代码,这是一个综合性的; 图像套色校正异常,这个报错挺难搞的。

作者头像 李华
网站建设 2026/8/19 13:05:40

YOLO26矿场矿车坐人数据集 YOLO识别乘坐的煤矿矿车 正常情况下的矿车人员乘坐情况 构建矿场矿车坐人检测深度学习模型

使用PyTorch框架和YOLOv5模型训练矿场矿车坐人数据集 来识别乘坐的煤矿矿车、正常情况下的矿车人员乘坐情况 构建矿场矿车坐人检测深度学习模型 文章目录使用PyTorch框架和YOLOv5模型训练矿场矿车坐人数据集 来识别乘坐的煤矿矿车、正常情况下的矿车人员乘坐情况 构建矿场矿车坐…

作者头像 李华
网站建设 2026/8/19 13:04:23

没有工作经验如何用AI做简历?5步从0到1制作一份能过ATS的简历

文章目录一、先破除一个致命误区&#xff1a;没有工作经验 ≠ 没有简历可写二、先建立一个判断标准&#xff1a;什么样的「0 经验简历」才算合格三、技术原理&#xff1a;AI 是怎么「无中生有」帮你写出简历的四、5步实操流程&#xff1a;从「一片空白」到「一份能投的简历」五…

作者头像 李华
网站建设 2026/8/19 12:59:15

毫米波雷达在自动驾驶中的核心原理、应用与挑战

1. 项目概述&#xff1a;毫米波雷达如何成为无人驾驶的“全天候之眼”在无人驾驶这个技术密集的竞技场里&#xff0c;传感器是车辆的“眼睛”和“耳朵”。激光雷达&#xff08;LiDAR&#xff09;因其高分辨率点云图而备受瞩目&#xff0c;常被比作“眼睛”&#xff0c;而摄像头…

作者头像 李华