原文链接:https://arxiv.org/pdf/2605.16137
项目链接:https://lan555.github.io/stable/【无code】
发表:ICML 2026
一、研究动机
1. 领域背景
在具身AI领域,合成数据因成本低、易扩展的优势,已成为机器人操作模型训练与评估的核心数据来源。其中,生成与任务指令对齐的多样化桌面场景,可以为机器人仿真提供丰富的环境,是当前备受关注的研究方向。该任务的核心挑战在于:既要准确理解高层任务指令的语义,又要保证生成场景的物理合理性,使其可以直接用于物理仿真(即 simulation-ready)。
2. 现有方法的核心缺陷
现有任务到场景的生成方法存在两类难以解决的问题:
LLM主导的生成方法存在空间推理短板
无论是零样本LLM、多轮提示策略还是数据集微调的LLM,都只能将高层语义转化为结构化布局,但无法精准建模连续3D几何关系,生成的场景普遍存在物体穿透碰撞、悬空漂浮等非物理现象,无法直接用于仿真。本质原因是LLM存在幻觉问题,且3D空间推理能力存在固有局限。事后物理优化存在语义漂移与鲁棒性问题
现有事后优化方法虽能一定程度改善物理合理性,但存在明显缺陷:
- 计算开销大,且当初始布局碰撞严重时,往往无法找到可行解;
- 优化会强行移动物体以消除碰撞,破坏原始布局的语义关系,导致场景偏离任务指令(例如指令要求“苹果放在香蕉左边”,优化后可能被移到右边);
- 容易产生杂乱、不符合真实分布的布局。
- 方法间的固有权衡
LLM类方法语义对齐性好但物理合理性差;事后优化类方法能消除碰撞但会损失语义对齐。现有方法始终无法同时兼顾“严格符合任务指令”和“物理仿真就绪”两个目标。
基于此,论文受认知科学“双系统”思路启发,提出STABLE语义-物理双系统框架,将语义布局生成与物理位姿校正解耦,在保证语义对齐的前提下实现物理可信的场景生成。
二、方法概述
STABLE是一个渐进式语义-物理双系统的桌面布局生成框架,核心设计是交替执行“语义扩展”与“物理校正”两个步骤,从任务核心物体到背景物体逐步构建完整场景。
- 语义推理器(Semantic Reasoner):基于微调的大语言模型,负责理解任务指令,分阶段生成粗略的结构化场景布局,保证场景与任务语义对齐;
- 物理校正器(Physics Corrector):基于几何感知的流匹配去噪模型,接收粗略布局后,仅通过调整物体的位置与旋转来消除碰撞、漂浮等物理问题,不改变物体的身份、尺寸和语义关系。
通过三轮“语义推理器添加物体 → 物理校正器修正位姿”的循环,STABLE可以逐步生成任务对齐、物理合理、可直接用于仿真的桌面场景。
三、方法详细说明
1. 整体框架与训练流程(对应图(a))
STABLE采用模块化解耦设计,两个模块基于同一套分级场景数据分别独立训练,整体训练流程如图(a)所示。
(1)共享输入数据:三级渐进式场景标注
训练数据基于MesaTask-10K数据集,将每个桌面场景的物体拆分为三级,形成序列化的子布局:
- 任务导向物体(( O t (O^t(Ot)):指令中明确指定、完成任务必需的核心物体;
- 重要背景物体(( O B (O^B(OB)):与任务物体有直接物理接触或距离极近的关联物体;
- 次要背景物体(( O b (O^b(Ob)):剩余的环境点缀物体。
每一级都对应“任务prompt + 已有物体集合”的输入形式,用于训练模型的渐进生成能力。
(2)语义推理器训练(左侧)
- 模型基底:基于Qwen3-8B大语言模型进行有监督微调(SFT);
- 输入:分级的prompt与物体上下文(任务级:仅prompt;重要背景级:prompt+(Ot);次要背景级:prompt+(Ot+O^B));
- 输出:结构化JSON格式的布局,包含每个物体的类别、包围盒尺寸、3D位置、偏航角、文本描述;
- 设计要点:移除长推理链,让模型直接输出结构化布局,大幅减少token长度与生成延迟;三级序列化训练让模型学会“先核心后背景”的渐进式构图逻辑,强化任务指令的语义锚定效果。
(3)物理校正器训练(右侧)
物理校正器是一个以几何特征为条件的流匹配去噪模型,训练目标是学习从“有物理缺陷的粗略位姿”到“物理合理位姿”的修正过程。
几何条件编码:
- 根据语义布局的物体描述,从3D资产库检索对应网格模型;
- 对每个物体的网格采样表面点云;
- 通过冻结的PVT-3(PointVoxel Transformer v3)编码器提取几何嵌入,作为校正模型的条件输入。
这种几何感知设计让模型可以处理堆叠、容纳等复杂空间关系,而不仅依赖粗糙的包围盒信息。
流匹配生成目标:
将所有物体的3D位置+偏航角拼接为位姿向量,在粗略位姿上加高斯噪声作为起点,以真实合理位姿为终点,用线性插值构造中间状态,训练U-Net结构的速度场网络预测位姿修正的速度。这种设计让模型学习到“围绕粗略布局做局部修正”的行为,不会大幅改动语义布局。物理约束损失:
为了严格保证仿真就绪性,训练中加入了三类网格级有向距离场(SDF)损失:- 物体-物体SDF损失:惩罚任意两个物体之间的网格穿透;
- 物体-桌面SDF损失:惩罚物体穿入桌面的现象;
- 支撑接触损失:检测每个物体的支撑面(桌面或其他物体),约束物体底部与支撑面的距离在容差内,消除漂浮现象,同时保证堆叠结构的稳定性。
2. 渐进式推理流程(对应图(b))
推理时采用三轮交替循环的渐进式生成范式,时间线与模块对应关系如图(b)所示:
Loop 1((t 0 t_0t0→ \to→t 1 t_1t1)):任务核心物体生成
语义推理器接收任务指令与桌面规格,先生成任务核心物体集合(O t O^tOt)的粗略布局;检索对应3D资产后,送入物理校正器修正碰撞与漂浮,得到第一版物理合理的子布局。Loop 2((t 3 t_3t3$\tot 4 t_4t4)):重要背景物体补充
以上一轮校正后的布局为上下文,语义推理器补充重要背景物体(O B O^BOB);再次检索资产后,物理校正器对新增后的全部物体重新做位姿修正,消除新增物体带来的碰撞。Loop 3((t 5 t_5t5$\tot 6 t_6t6)):次要背景物体补充
继续补充次要背景物体(O b O^bOb),最终经过物理校正后,输出完整的、可直接用于仿真的桌面场景布局。
这种“每加一层物体就做一次物理校正”的设计,既避免了误差累积导致的严重碰撞,又天然支持增量式的场景编辑与调整。同时由于两个模块解耦,推理时可以采用批处理流水线调度:一个场景做物理校正时,其他场景可以并行做语义扩展,提升整体生成吞吐量。
3. 核心设计优势
- 语义不漂移:物理校正器只调整位置和旋转,不改变物体身份、数量和相对语义关系,保证严格对齐任务指令;
- 物理高可信:网格级SDF约束+流匹配连续优化,相比传统迭代优化鲁棒性更强,即使初始碰撞严重也能生成无碰撞、无漂浮的布局;
- 生成渐进式:从核心到背景的分级生成,既强化了任务关键物体的优先级,又能生成丰富自然的杂乱桌面场景。