北京、上海、苏州RemoteFull TimePosted Today
训练推理优化工程师(Mstar)Mstar北京、上海、苏州Mstar计划职位描述负责Momenta自动驾驶大模型、世界模型的分布式训练推理框架研发,主要包括:
1、参与设计、研发、维护团队内部的模型分布式训练框架,擅长分析并深度优化训练各个阶段的性能瓶颈,包括计算效率、通信延迟、显存占用等;
2、结合不断迭代的模型算法逻辑,设计并实现针对性的高效分布式并行训练策略;
3、深入研究 CUDA、NCCL、RDMA 等编程范式和通信库,针对团队内部的GPU和集群拓扑约束,开发高性能算子 并 优化分布式通信效率,达到行业SOTA水平;
4、深入研究低精度混合精度训练策略,在保证模型精度满足预期的情况下,探索低精度(FP8、FP4)训练的性能极限;
5、配合算法需求,开发RL训练框架、迭代RL训练算法逻辑,优化在线Rollout推理性能,深度优化分布式On-Policy/异步RL训练效率。职位要求学历背景: 计算机相关专业硕士及以上学历,具备扎实的理论基础和强大的动手能力;
编程能力:
- 熟悉 Python/C++/CUDA/CUTLASS/Triton编程,熟悉PyTorch框架及其底层实现;
- 熟悉分布式系统开发与调试,熟悉分布式通信开发NCCL/RDMA/IB/RoCE,有多进程调度与并行算法优化经验者优先;
训练与推理经验:
- 熟悉大模型结构与算法(LLM/VLM/VLA/DiT、MoE架构、各种RL算法等);
- 熟悉分布式训练/推理的常用策略(DP/TP/PP/EP/CP、recompute、offloading、PD分离等);
- 有主流开源分布式训练框架(如Megatron-LM、DeepSpeed、VeRL)或推理框架(如SGLang、vLLM)的深度二次开发与优化经验。投递
