返回开放职位

RL 后训练 · 策略优化

RL 后训练研究员

负责具身大脑的 RL 后训练,让预训练能力在真实、长程且存在不确定性的任务中持续提升。

深圳全职模型研究
投递简历

岗位职责

  1. 01研发面向具身智能的 RL 后训练方法,提升模型在长程任务、环境变化和执行扰动下的成功率与恢复能力
  2. 02研究离线与在线强化学习、偏好学习、奖励建模和策略改进方法,建立适合真实机器人反馈的训练范式
  3. 03设计高质量 rollout、困难样本挖掘与反馈数据闭环,让失败、纠正与稀有场景持续转化为模型能力
  4. 04建立覆盖仿真、离线回放与真机任务的评测体系,区分策略提升、数据分布变化与评测波动
  5. 05协同预训练、数据和机器人团队推进算法落地,解决训练稳定性、样本效率和真实部署约束

任职要求

  • 计算机、人工智能、自动化等相关专业,硕士及以上学历;具有突出研究或工程成果者可适当放宽
  • 扎实掌握强化学习基础,理解策略梯度、Actor-Critic、离线强化学习、模型式强化学习等核心方法及其适用边界
  • 真正训练过机器人策略、VLA 模型或大模型 RL 系统,能够独立设计目标、运行训练并证明策略提升
  • 熟练使用 PyTorch,具备分布式训练、并行 rollout 或大规模强化学习系统的实践经验
  • 理解真实机器人数据昂贵、反馈延迟和安全约束等问题,重视样本效率与实验可复现性
  • 研究判断严谨,能够从复杂实验中识别真正有效的改进并推动其稳定落地

加分项

  • 在强化学习、机器人学习或大模型后训练方向发表过高质量研究成果
  • 具备真实机器人强化学习、遥操作反馈或大规模仿真训练经验
  • 熟悉奖励模型、偏好数据、过程监督或自动化评测系统