上海Full TimeSeniorPosted Today
强化学习后训练算法工程师/专家-Genie业务部上海校招正式技术族 - 算法类职位 ID:A105347职位描述1.负责真机强化学习算法研发,面向在线/离线场景设计高样本效率、稳定可靠的 RL 训练方案,持续提升任务成功率、稳定性与鲁棒性。
2.构建 VLA 模型的 RL 后训练体系,探索具身领域的数据配方与 scaling law,沉淀可复用的训练范式与评测结论。
3.探索灵巧手/双臂等接触丰富(contact-rich)操作任务的策略学习方法,融合触觉、力觉与视觉信息,提升抓取、调整、重抓(regrasp)与精细操作能力。
4.面向复杂与长时序任务,构建训练—评测—迭代闭环,解决真机 RL 中的 reward 设计、自动 reset、安全探索等关键问题。
5.与数据/系统/硬件团队协作,推进模型训练、验证、部署与迭代落地。
6.跟踪 RL 与具身智能前沿进展,撰写技术文档和学术论文。职位要求1.硕士及以上学历,计算机/机器人/自动化/AI 等相关专业。
2.具备扎实的深度学习、强化学习知识基础,熟悉 PPO/SAC/TD3 等主流算法,理解 online/offline RL 的差异与适用场景。
3.对前沿 RL 算法有研究与实践经验,如 flow-matching/diffusion/离散 Action Token 的强化学习等。
4.有真机闭环训练部署测试经验者、分布式真机强化学习经验者优先。
5.熟悉主流 VLA 路线(π 系列等),有 VLA 后训练/复现/改进经验者优先。
6.有灵巧手/接触操作任务经验,熟悉触觉/力觉建模、in-hand manipulation 等方向者优先。
7.熟练使用 PyTorch、 RLINF、VeRL 等框架者优先。
8.顶会论文或同等研究/工程成果优先(NeurIPS/ICLR/CoRL/RSS/ICRA/IROS 等)。投递
