北京、上海、苏州InternshipEntry-levelPosted Today
端到端决策规划算法实习生(Mstar)北京、上海、苏州Mstar计划职位描述1、面向端到端自动驾驶大模型,研究并落地RL、On-policy Distillation等后训练范式,提升模型在复杂驾驶场景下的决策质量与泛化能力;
2、结合Momenta海量量产真实路测数据,设计数据闭环驱动的后训练策略,加速模型在长尾驾驶场景中的能力提升;
3、对比和融合SFT、RL、On-policy Distillation等范式,针对驾驶决策任务的特殊性设计最优后训练方案;
4、结合分布式训练框架优化后训练系统效率,推动模型从研究到量产的快速迭代;
5、追踪并复现LLM、端到端自动驾驶领域最新研究成果。职位要求1、计算机、人工智能等相关专业硕士/博士应届毕业生;
2、必须具备Flow Matching相关经验;
3、深入理解后训练核心范式,对以下概念有实质性认知:
- On-Policy Vs Off-policy采样的本质区别
- Dense vs Sparse Reward对训练效果与收敛的影响
4、在以下至少一个方向有研究或工程实践经验:
- RL后训练(PPO、GRPO、RLHF 等)
- On-policy/Sequence-level蒸馏(GKD、MiniLLM、DAGGER 相关方法)
5、熟悉至少一种主流训练框架(VeRL、Megatron-LM、DeepSpeed、vLLM等);
6、有顶会论文(NeurIPS、ICML、ICLR等)或相关方向实习经历者优先。
加分项
1、同时具备Flow Matching与RL经验;
2、同时具备RL与蒸馏两个方向经验;
3、有Reward Model、Value Model或Token-level Scoring相关研究经验;
4、对自动驾驶决策、具身智能或物理AI场景有了解,理解驾驶轨迹数据与通用NLP数据的本质差异。投递
