news 2026/8/26 1:41:47

NERO 单臂 π0.5 VLA / DreamZero WAM + Isaac Lab + RLinf + LeRobot v3:SFT、RL、Sim-to-Real 完整闭环实施方案

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
NERO 单臂 π0.5 VLA / DreamZero WAM + Isaac Lab + RLinf + LeRobot v3:SFT、RL、Sim-to-Real 完整闭环实施方案

:::writing{variant=“document” id=“73164” title=“NERO 单臂 π0.5 VLA / DreamZero WAM + Isaac Lab + RLinf + LeRobot v3:SFT、RL、Sim-to-Real 完整闭环实施方案”}

第1章 项目目标与最终闭环

1.1 项目目标

步骤属性:非操作步骤(方案/知识点)

本文目标是围绕单臂NERO 7 自由度机械臂(NERO 7-DoF Robotic Arm)+AgileX 两指夹爪(AgileX Gripper),建立一套可以持续循环迭代的具身智能实验平台。

你的计算架构定义为:

  • RTX 6000 PRO 96GB:私有“云端”;
  • NERO:真实机器人执行端;
  • Isaac Sim / Isaac Lab:数字孪生与仿真训练端;
  • RLinf:统一的 SFT / RL 训练基础设施;
  • LeRobotDataset v3:统一数据格式;
  • π0.5:第一条 VLA 主线;
  • DreamZero + Wan2.2-TI2V-5B:第一条 WAM 主线。

最终必须实现:

Base Model→Sim Eval→Real Eval→Data→SFT→RL→Sim Eval→Real Eval→New Data→Retrain\text{Base Model}\rightarrow\text{Sim Eval}\rightarrow\text{Real Eval}\rightarrow\text{Data}\rightarrow\text{SFT}\rightarrow\text{RL}\rightarrow\text{Sim Eval}\rightarrow\text{Real Eval}\rightarrow\text{New Data}\rightarrow\text{Retrain}Base ModelSim EvalReal EvalDataSFTRLSim EvalReal EvalNew DataRetrain

即真正的数据飞轮(Data Flywheel)


1.2 第一阶段与第二阶段

步骤属性:非操作步骤(方案/知识点)

第一阶段:

不更新模型参数

即:

θ=θbase\theta=\theta_{base}θ=θbase

先测试 π0.5 Base:

  • Isaac Lab 仿真表现;
  • NERO 真机 Shadow Mode;
  • NERO 真机低速执行表现。

得到基线:

SRsimbaseSR_{sim}^{base}SRsimbase

和:

SRrealbaseSR_{real}^{base}SRrealbase

第二阶段:

利用:

DsimD_{sim}Dsim

和:

DrealD_{real}Dreal

进行:

  1. 监督微调(Supervised Fine-Tuning, SFT)
  2. 数据集聚合(Dataset Aggregation, DAgger)
  3. 强化学习(Reinforcement Learning, RL)
  4. 仿真-真机协同训练(Sim-Real Co-Training)

1.3 RTX 6000 PRO 的角色

步骤属性:非操作步骤(方案/知识点)

RTX 6000 PRO 96GB 是你的私有:

训练服务器(Training Server)

    推理服务器(Inference Server)

      仿真服务器(Simulation Server)

      其职责为:

      RTX 6000 PRO 96GB │ ├── Isaac Sim ├── Isaac Lab ├── RLinf ├── LeRobot v3 ├── π0.5 SFT ├── π0.5 PPO ├── DAgger ├── Sim-Real Co-Training ├── DreamZero SFT └── Policy Inference Service

      所以第一阶段完全可以不使用 Jetson Orin。


      第2章 模型选型

      2.1 VLA 选择 π0.5

      步骤属性:非操作步骤(方案/知识点)

      推荐:

      π0.5(Pi Zero Point Five)

      原因:

      • RLinf 已支持 π0 / π0.5 的SFT
      • RLinf 已支持 π0.5 的PPO(Proximal Policy Optimization)
      • RLinf 已支持 Isaac Lab + π0.5;
      • RLinf 已支持 π0 / π0.5 的 DAgger;
      • RLinf 已支持 π0.5 的 Sim-Real Co-Training;
      • OpenPI 原生提供远程推理服务;
      • NERO 已出现 π0.5 社区 checkpoint / 数据 / RoboTwin 接入案例。

      RLinf 官方当前已经提供 Isaac Lab + π0.5 + PPO 示例,并使用 7 维动作:

      [x,y,z,roll,pitch,yaw,gripper][x,y,z,roll,pitch,yaw,gripper][x,y,z,roll,pitch,yaw,gripper]


      2.2 WAM 选择 DreamZero 5B

      步骤属性:非操作步骤(方案/知识点)

      推荐:

      DreamZero(DreamZero)

        Wan2.2-TI2V-5B

        DreamZero 当前在 RLinf 中已经有完整:

        • SFT;
        • Mixture SFT;
        • LeRobot v2 / v3;
        • Franka Pick-and-Place;
        • DROID;
        • LIBERO;

        路径。

        但是当前 RLinf 没有现成:

        nero_pnp

        因此 DreamZero + NERO 需要增加一次本体注册(Embodiment Registration)


        2.3 WAM 的 RL 边界

        步骤属性:非操作步骤(重要知识点)

        目前可以直接可靠落地的:

        DreamZero + RLinf

        主线是:

        DreamZero Base→SFT→Evaluation\text{DreamZero Base}\rightarrow\text{SFT}\rightarrow\text{Evaluation}DreamZero BaseSFTEvaluation

        目前没有我能确认的 RLinf 官方:

        DreamZero + NERO + PPO

        完整现成 recipe。

        所以本文:

        强化学习主线放在 π0.5 上

        DreamZero 先用于:

        • WAM SFT;
        • Sim / Real 对比;
        • 世界模型能力实验。

        不要自行臆造 DreamZero PPO 配置。


        第3章 最终系统架构

        3.1 总体架构

        步骤属性:非操作步骤(方案/知识点)

        RTX 6000 PRO 96GB ┌───────────────────────────────────────────────────────────────┐ │ │ │ Isaac Sim / Isaac Lab │ │ │ │ │ ├── NERO Digital Twin │ │ ├── Red Cube │ │ ├── Green Tray │ │ ├── Front Camera │ │ ├── Wrist Camera │ │ ├── Teleoperation │ │ ├── RL Rollout │ │ └── Sim Evaluation │ │ │ │ │ ▼ │ │ LeRobotDataset v3 │ │ │ │ │ ┌────────┴────────┐ │ │ ▼ ▼ │ │ RLinf + π0.5 RLinf + DreamZero │ │ SFT / PPO WAM SFT │ │ │ │ │ │ └────────┬────────┘ │ │ ▼ │ │ Policy Server │ └─────────────────────────┬─────────────────────────────────────┘ │ Ethernet / Wi-Fi │ NERO Client │ Safety Adapter │ IK │ pyAgxArm │ ▼ NERO + Gripper │ ▼ Real Dataset │ └──────────────→ RLinf

        第4章 本体契约 Embodiment Contract

        4.1 为什么必须存在 Embodiment Contract

        步骤属性:非操作步骤(知识点)

        无论使用 π0.5、DreamZero、GR00T、OpenVLA,模型与机器人之间都必须解决:

        • 本体适配层(Embodiment Adapter)
        • 状态/动作定义(State/Action Schema)
        • 归一化统计(Normalization Statistics)
        • 相机键映射(Camera Mapping)
        • 安全适配器(Safety Adapter)

        所谓某机器人“官方支持”,只意味着这些代码已经有人写好。


        4.2 固定状态空间

        步骤属性:需要操作的步骤

        统一定义:

        st=[q1,q2,q3,q4,q5,q6,q7,g]s_t=[q_1,q_2,q_3,q_4,q_5,q_6,q_7,g]st=[q1,q2,q3,q4,q5,q6,q7,g]

        因此:

        dim⁡(st)=8\dim(s_t)=8dim(st)=8

        其中:

        • q1∼q7q_1\sim q_7q1q7:NERO 七关节;
        • ggg:夹爪状态。

        仿真和真机必须完全一致。


        4.3 固定动作空间

        步骤属性:需要操作的步骤

        第一版建议使用:

        at=[Δx,Δy,Δz,Δrx,Δry,Δrz,g]a_t=[\Delta x,\Delta y,\Delta z,\Delta r_x,\Delta r_y,\Delta r_z,g]at=[Δx,Δy,Δz,Δrx,Δry,Δrz,g]

        即:

        dim⁡(at)=7\dim(a_t)=7dim(at)=7

        这是末端增量动作空间(End-Effector Delta Action Space)

        理由:

        • RLinf IsaacLab π0.5 官方示例也是 7 维 Cartesian + Gripper;
        • NERO Isaac Lab 自动采集示例已经使用相同 7 维结构;
        • NERO 官方社区代码明确返回:

        [Δx,Δy,Δz,Δrx,Δry,Δrz,gripper][\Delta x,\Delta y,\Delta z,\Delta r_x,\Delta r_y,\Delta r_z,gripper][Δx,Δy,Δz,Δrx,Δry,Δrz,gripper]

        最终:

        at→Differential IK→qtargeta_t\rightarrow\text{Differential IK}\rightarrow q_{target}atDifferential IKqtarget


        4.4 固定相机

        步骤属性:需要操作的步骤

        只使用:

        observation.images.front observation.images.wrist

        即:

        前视相机(Front Camera)

          腕部相机(Wrist Camera)

          第一阶段不把 Depth 输入 VLA。


          4.5 固定语言 Prompt

          步骤属性:需要操作的步骤

          统一:

          Pick up the red cube and place it in the green tray.

          仿真和真机必须一模一样。


          4.6 建立归一化统计

          步骤属性:需要操作的步骤

          RLinf 明确要求对新的 LeRobot dataset 计算 state / action normalization statistics。

          使用:

          python toolkits/lerobot/calculate_norm_stats.py\--config-name pi05_nero_cartesian\--repo-id /data/nero_redcube_sim_v001

          正式 Real SFT 前对真实数据也重新计算。


          4.7 建立 Safety Adapter

          步骤属性:需要操作的步骤

          禁止:

          π0.5 → NERO

          必须:

          π0.5 ↓ Action Chunk ↓ Safety Adapter ↓ IK ↓ Interpolation ↓ pyAgxArm ↓ NERO

          至少实现:

          ∣Δx∣<Δxmax|\Delta x|<\Delta x_{max}∣Δx<Δxmax

          ∣Δy∣<Δymax|\Delta y|<\Delta y_{max}∣Δy<Δymax

          ∣Δz∣<Δzmax|\Delta z|<\Delta z_{max}∣Δz<Δzmax

          ∣Δr∣<Δrmax|\Delta r|<\Delta r_{max}∣Δr<Δrmax

          以及:

          qimin≤qi≤qimaxq_i^{min}\le q_i\le q_i^{max}qiminqiqimax

          还必须有:

          • Workspace Limit;
          • Joint Velocity Limit;
          • NaN / Inf;
          • Self Collision;
          • Table Collision;
          • Network Timeout;
          • Command Timeout;
          • Watchdog;
          • Physical E-Stop。

          第5章 软件版本与环境

          5.1 版本策略

          步骤属性:需要操作的步骤

          不要长期跟随main不固定版本。

          建议第一次实验:

          • Ubuntu 22.04;
          • RLinf 固定一个 git SHA;
          • Isaac Sim 5.1.0;
          • Isaac Lab 与 RLinf 当前 IsaacLab recipe 对齐;
          • LeRobot >= 0.4;
          • CUDA Driver 满足 Isaac Sim / RLinf 要求。

          RLinf 当前 IsaacLab 官方教程明确使用 Isaac Sim 5.1.0。

          第一次部署后记录:

          gitrev-parse HEAD pip freeze>requirements.lock.txt nvidia-smi>gpu_env.txt

          5.2 推荐环境拆分

          步骤属性:需要操作的步骤

          建议:

          env 1: nero_isaac_teleop env 2: rlinf_openpi env 3: rlinf_dreamzero env 4: nero_real

          不要全部 pip 到一起。


          第6章 代码库

          6.1 必须下载的仓库

          步骤属性:需要操作的步骤

          RLinf:

          urlRLinf GitHubhttps://github.com/RLinf/RLinf

          OpenPI:

          urlPhysical Intelligence OpenPIhttps://github.com/Physical-Intelligence/openpi

          Isaac Lab:

          urlIsaac Labhttps://github.com/isaac-sim/IsaacLab

          NERO Isaac Lab 数据采集:

          urlNERO IsaacLab Data Collectionhttps://github.com/szyzp/IsaacLab_Data_Collection

          NERO SDK:

          urlpyAgxArmhttps://github.com/agilexrobotics/pyAgxArm

          NERO ROS2:

          urlagx_arm_roshttps://github.com/agilexrobotics/agx_arm_ros

          DreamZero:

          urlDreamZerohttps://github.com/dreamzero0/dreamzero

          RLinf DreamZero:

          urlRLinf DreamZero Forkhttps://github.com/RLinf/dreamzero

          LeRobot:

          urlLeRobothttps://github.com/huggingface/lerobot


          第7章 搭建 NERO Isaac Lab 仿真

          7.1 使用现有 NERO Isaac Lab 工程

          步骤属性:需要操作的步骤

          不要从零写 NERO。

          现有 NERO 社区工程已经支持:

          • NERO 7DoF;
          • Gripper;
          • URDF → USD;
          • Differential IK;
          • Keyboard;
          • SpaceMouse;
          • HDF5;
          • Replay;
          • Block stacking。

          7.2 URDF 转 USD

          步骤属性:需要操作的步骤

          示例:

          python../IsaacLab/scripts/tools/convert_urdf.py\/path/to/nero_gripper.urdf\/path/to/nero.usd\--fix-base

          该路径已被 NERO Isaac Lab 项目验证。


          7.3 验证机械臂模型

          步骤属性:需要操作的步骤

          必须确认:

          • 7 个关节正确;
          • Gripper 正确;
          • Joint Limit 正确;
          • Collision Mesh 正确;
          • Mass / Inertia 正常;
          • 无剧烈抖动;
          • 无 physics explosion。

          如发生抖动,NERO 教程建议:

          • 增大 solver iteration;
          • 降低 stiffness;
          • 增加 damping;
          • 必要时关闭相邻 link self collision。

          第8章 创建红色方块 Pick-and-Place

          8.1 任务环境

          步骤属性:需要操作的步骤

          建立:

          Table │ ├── Red Cube ├── Green Tray ├── Front Camera ├── NERO │ └── Wrist Camera └── Gripper

          红方块:

          4∼5 cm4\sim5\text{ cm}4

          版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
          网站建设 2026/8/26 1:40:55

          大数据可视化在求职租房关联分析中的应用实践

          1. 项目背景与核心价值这个毕业设计选题完美结合了当前最热门的两个民生需求——求职与租房&#xff0c;通过大数据技术实现可视化分析。我在指导学生完成类似项目时发现&#xff0c;这类系统不仅能展示技术实力&#xff0c;更能解决实际问题。市面上现有的招聘平台和租房APP往…

          作者头像 李华
          网站建设 2026/8/26 1:40:37

          MES生产车间物料管理:降本增效的实战策略

          1. 引言在制造企业的生产车间中&#xff0c;物料管理直接影响生产成本、交付周期和产品质量。物料管理不善&#xff0c;往往表现为账实不符、库存积压、缺料停线、呆滞料增多等问题&#xff0c;这些都会推高制造成本、拉低生产效率。MES&#xff08;制造执行系统&#xff09;作…

          作者头像 李华
          网站建设 2026/8/26 1:38:32

          PotPlayer OSD信息管理全攻略:彻底关闭左上角时间显示与界面定制

          1. 问题定位&#xff1a;左上角那个“碍眼”的时间戳到底是什么&#xff1f;如果你和我一样&#xff0c;是个对播放器界面有“洁癖”的用户&#xff0c;那么在使用PotPlayer时&#xff0c;左上角那个默认显示的播放时间戳&#xff0c;确实会让人感觉有点碍眼。尤其是在观看电影…

          作者头像 李华
          网站建设 2026/8/26 1:36:44

          Excel查找函数选型:VLOOKUP、XLOOKUP、INDEX+MATCH对比

          先把一个结论放在前面&#xff1a;Excel查找函数真正值得花时间研究的&#xff0c;不是“哪个函数最厉害”&#xff0c;而是“你的表格结构到底更适合哪种查询方式”。我见过不少人在VLOOKUP里卡了大半天&#xff0c;报错原因其实和函数本身没关系&#xff0c;而是数据源里多了…

          作者头像 李华
          网站建设 2026/8/26 1:35:09

          【养老照护微项目管理实务连载】10.2 规划相关方参与

          规划相关方参与是在已识别相关方的基础上&#xff0c;根据相关方的权力、利益、诉求、影响力与支持态度&#xff0c;分析各方参与度现状与期望目标&#xff0c;制定针对性沟通策略、参与方式、关系维护路径与冲突预防方案的过程。本过程的主要作用是&#xff1a;为后续相关方参…

          作者头像 李华
          网站建设 2026/8/26 1:33:27

          《WMS 仓储系统集成 AI Agent 实战》系列总纲

          一套完整的开源实战教程&#xff1a;把传统 WMS 仓储系统接入本地大模型&#xff0c;让用户用自然语言完成查库存、开单据、搜知识库等真实业务操作。这是个什么项目&#xff1f;一句话&#xff1a;ERP 仓储 AI 智能体。用户对 AI 说"查询物料 ZL001 的库存"&#x…

          作者头像 李华