惠州RemoteFull TimePosted Today
AI智算平台工程师(DMC)惠州全职职位描述1.算力平台规划与建设:主导GPU集群、InfiniBand/RoCE高速网络及分布式存储的架构设计、部署与硬件调优。
2.资源调度与效能提升:基于K8s/Volcano/Slurm优化调度策略,提升GPU利用率与集群整体MFU。
3.算力成本与运营:建立FinOps成本模型,通过弹性伸缩与闲时资源整合,降低单位算力成本。
4.智能化运维体系:构建全链路监控(Prometheus),利用AIOps实现故障预测与自动化运维。
5.模型部署与推理优化:使用vLLM/Triton/TensorRT部署大模型,实施量化(INT8/FP8)、动态批处理等优化技术。
6.混合云管理:维护公有云与私有云的混合云架构,确保资源统一调度与数据一致性。
7.服务稳定性保障:确保在线推理服务的高可用与低延迟,设计熔断、降级、限流策略。职位要求一、核心要求
1.技术栈深度:精通 Linux、K8s、Python/Go 自动化,熟悉 GPU 硬件与 NVIDIA 生态(CUDA、DCGM)。
2.算力平台经验:3年以上云计算或AI基础设施经验,具备百卡级GPU集群的运维、调优实战经验。
3.高性能网络:熟练掌握 InfiniBand/RoCE 网络配置与 NCCL 通信问题排查。
4.模型工程化能力:熟悉大模型本地化部署流程,有 vLLM、TensorRT-LLM 等推理框架的生产环境优化经验。
5.云原生与监控:深入理解云原生架构,能熟练搭建Prometheus/Grafana 全链路监控体系。
加分项
1.大规模集群经验:有千卡级别训练集群的运维优化或故障治理经验。
2.国产化生态:熟悉华为昇腾、海光DCU等国产AI芯片的适配与开发生态。
3.开源贡献:在 vLLM、TensorRT-LLM 等主流推理框架有代码贡献。
4.前沿技术实践:对 MoE 模型、多模态大模型的端侧部署与优化有实际探索。投递
