建立扩散概率模型用于强化学习策略表征的理论与算法基础
Langevin Policy 入选 ICML 2024,推进安全强化学习研究
深圳市深度跃迁科技有限公司正式成立,启动世界表征模型研发
完成 DELE-w0 预训练、微调、强化学习全流程训练
完成 DELE-w0.5 模型训练,世界表征模型能力演进进入新阶段