研究成果

从策略学习到世界表征模型,持续推进机器人智能

arXiv:2608.220672026

Inferring Action from Future Latent State for Robotic Manipulation

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Jie Cheng, Peilin Huang, Cong Fang, Han Fu, Zhuo Li, Xiaoxue Ren

世界—动作模型(WAM)以视频生成骨干网络构建机器人控制,同时预测稠密的未来视觉轨迹与机器人动作。我们认为,对于世界—动作建模而言,视频生成是一个不必要的中间目标。对机器人操作来说,世界模型的目标并非复现世界在每个中间时刻的视觉形态,而是预测动作执行后世界将到达的状态。中间帧只描述物理状态之间的视觉过渡,消耗大量模型容量与计算,却不能直接刻画机器人动作意图产生的物理结果。本文提出 DELE-w0.5:无需依赖视频生成,即可从预测的未来状态推断机器人动作。具体而言,DELE-w0.5 从与动作序列对应的紧凑未来潜在状态中推断动作序列。未来潜在状态捕捉机器人交互中与动作相关的物理结果,并作为连接世界建模与动作生成的显式桥梁。DELE-w0.5 的核心设计原则是建模物理世界如何随机器人动作而变化,而非其视觉外观如何逐帧演化。这一表述消除了稠密视频表示引入的高维视觉冗余,从而降低训练成本并实现低延迟推理。在四项长程操作任务的 480 次真实机器人试验中,DELE-w0.5 在所有对比策略中取得最佳表现:整体完整任务成功率达到 62.5%,宏平均有序阶段进度达到 81.3%,分别比最强基线高 47.5 和 30.7 个百分点。

查看项目页PDF
ICML 2024 · PMLR 2352024

Langevin Policy for Safe Reinforcement Learning

Fenghao Lei, Long Yang, Shiting Wen, Zhixiong Huang, Zhiwang Zhang, Chaoyi Pang

现有安全强化学习方法主要建立在优化框架上,而采样方法能否得到有效的安全策略仍缺少研究。本文提出用于安全强化学习的 Langevin Policy,以连续时间 Langevin 动力学的数值求解过程直接推断动作;进一步提出 Langevin Actor-Critic(LAC),积累 Langevin Policy 产生的转移,并通过生成器复现这些动作以加速推理。MuJoCo 与 Safety Gym 实验展示了该方法在回报与安全约束之间的有效平衡。

查看项目页PDF
arXiv:2305.131222023

Policy Representation via Diffusion Probability Model for Reinforcement Learning

Long Yang, Zhixiong Huang, Fenghao Lei, Yucun Zhong, Yiming Yang, Cong Fang, Shiting Wen, Binbin Zhou, Zhouchen Lin

常见强化学习算法往往产生单峰策略分布,限制复杂策略的表达能力和探索能力。本文建立了使用扩散概率模型表示策略的理论基础,将扩散策略刻画为随机过程并给出收敛保证。在此基础上,论文提出 DIPO,通过 action gradient 改进经验数据中的动作,使扩散策略能够用于无模型在线强化学习。MuJoCo 连续控制实验验证了该方法的有效性。

查看项目页PDF