Back to Jobs
XPENG

具身大模型Infra Engineer

XPENG
深圳RemoteFull TimePosted Today
具身大模型Infra Engineer深圳全职智能机器人板块职位描述1. 大规模训练系统与 Scaling:面向可泛化、可持续 Scaling 的具身大模型(VLA Foundation Model),负责大规模分布式训练框架的设计、优化与迭代,支撑随数据量持续增长的训练需求,是基模能力持续突破的核心环节。 2. 训练性能优化与工程化落地:主导多模态大模型的训练性能优化——包括并行策略(数据/张量/流水/序列并行)、显存与通信优化、混合精度、算子与 IO 优化等,持续提升训练吞吐与资源利用率,缩短模型迭代周期。 3. 数据—训练链路建设:与数据、算法团队协作,打通「海量多模态数据→ 高效训练 → 快速验证」的闭环,保障数据规模增长下训练链路的稳定性与可扩展性。 4. 技术影响力:紧跟大模型训练系统与 infra 领域的国际前沿进展,通过关键技术攻坚沉淀方法论与基础设施,形成持续的技术影响力。职位要求1. 教育背景:计算机、电子工程、人工智能、自动化等相关专业硕士及以上学历; 2. 算法与系统基础:具备扎实的机器学习/深度学习基础,深入理解大模型(VLM / LLM / VLA 等)的训练原理与工程实践; 3. 编程与工具能力:精通 Python / C++,熟悉 Linux 环境与网络/性能分析;熟练使用 PyTorch,深入理解 CUDA、NCCL 及底层计算/通信机制,具备优秀的系统级代码实现能力; 4. 核心专业技能:具有丰富的大规模训练平台经验,熟悉主流分布式训练框架(如 Megatron-LM / DeepSpeed / FSDP / Ray 等),有千卡级别及以上大模型训练的性能剖析与优化实战经验;有多模态/具身大模型训练经验者优先; 5. 综合素质:对具身智能(Embodied AI)及大规模模型 Scaling 有浓厚兴趣;具备良好的跨团队沟通协作能力与复杂系统问题的解决能力,能在"数据—算法—训练平台"多方之间高效推进项目。投递
Ready to apply? You'll be taken to XPENG's application page.
具身大模型Infra Engineer at XPENG