Inferring Action from Future Latent State for Robotic Manipulation
Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Jie Cheng, Peilin Huang, Cong Fang, Han Fu, Zhuo Li, Xiaoxue Ren
世界—动作模型(WAM)以视频生成骨干网络构建机器人控制,同时预测稠密的未来视觉轨迹与机器人动作。我们认为,对于世界—动作建模而言,视频生成是一个不必要的中间目标。对机器人操作来说,世界模型的目标并非复现世界在每个中间时刻的视觉形态,而是预测动作执行后世界将到达的状态。中间帧只描述物理状态之间的视觉过渡,消耗大量模型容量与计算,却不能直接刻画机器人动作意图产生的物理结果。本文提出 DELE-w0.5:无需依赖视频生成,即可从预测的未来状态推断机器人动作。具体而言,DELE-w0.5 从与动作序列对应的紧凑未来潜在状态中推断动作序列。未来潜在状态捕捉机器人交互中与动作相关的物理结果,并作为连接世界建模与动作生成的显式桥梁。DELE-w0.5 的核心设计原则是建模物理世界如何随机器人动作而变化,而非其视觉外观如何逐帧演化。这一表述消除了稠密视频表示引入的高维视觉冗余,从而降低训练成本并实现低延迟推理。在四项长程操作任务的 480 次真实机器人试验中,DELE-w0.5 在所有对比策略中取得最佳表现:整体完整任务成功率达到 62.5%,宏平均有序阶段进度达到 81.3%,分别比最强基线高 47.5 和 30.7 个百分点。