岗位职责
- 01研发面向具身智能的 RL 后训练方法,提升模型在长程任务、环境变化和执行扰动下的成功率与恢复能力
- 02研究离线与在线强化学习、偏好学习、奖励建模和策略改进方法,建立适合真实机器人反馈的训练范式
- 03设计高质量 rollout、困难样本挖掘与反馈数据闭环,让失败、纠正与稀有场景持续转化为模型能力
- 04建立覆盖仿真、离线回放与真机任务的评测体系,区分策略提升、数据分布变化与评测波动
- 05协同预训练、数据和机器人团队推进算法落地,解决训练稳定性、样本效率和真实部署约束
任职要求
- 计算机、人工智能、自动化等相关专业,硕士及以上学历;具有突出研究或工程成果者可适当放宽
- 扎实掌握强化学习基础,理解策略梯度、Actor-Critic、离线强化学习、模型式强化学习等核心方法及其适用边界
- 真正训练过机器人策略、VLA 模型或大模型 RL 系统,能够独立设计目标、运行训练并证明策略提升
- 熟练使用 PyTorch,具备分布式训练、并行 rollout 或大规模强化学习系统的实践经验
- 理解真实机器人数据昂贵、反馈延迟和安全约束等问题,重视样本效率与实验可复现性
- 研究判断严谨,能够从复杂实验中识别真正有效的改进并推动其稳定落地
加分项
- 在强化学习、机器人学习或大模型后训练方向发表过高质量研究成果
- 具备真实机器人强化学习、遥操作反馈或大规模仿真训练经验
- 熟悉奖励模型、偏好数据、过程监督或自动化评测系统