北京Full TimePosted Today
大模型工程师-推理与部署优化北京社招全职技术 - 基础架构职位 ID:A23292职位描述1、负责大语言模型、多模态模型的推理引擎搭建、优化与线上落地,支撑高并发、低延迟的模型服务;
2、基于 vLLM、TensorRT-LLM、SGLang、LightLLM 等主流推理框架进行性能调优,并探索 推测性解码 (Speculative Decoding)、前缀缓存 (Prefix Caching) 等前沿加速技术;
3、负责大模型在 NVIDIA A/H 系列、昇腾 等国产加速卡上的适配与算子优化,解决兼容性与性能瓶颈;
4、设计与实现高性能模型 Serving 架构,包括 Prefill-Decode (PD) 分离架构、Continuous Batching (连续批处理)、负载均衡、流式输出等;
5、基于 Docker、Kubernetes 实现模型服务容器化编排、弹性扩缩容与运维稳定性保障;
6、定位并解决线上服务瓶颈:如显存碎片化、OOM、推理崩溃、时延抖动(Tail Latency)、多卡并行异常等;
7、与算法团队协作,将训练好的模型权重标准化、工程化,实现快速上线与迭代。职位要求1、本科及以上学历,计算机相关专业,2 年及以上大模型部署或推理优化相关经验;
2、熟悉多种主流大模型推理框架(如 vLLM, SGLang, TensorRT-LLM),深入理解其 PagedAttention、KV Cache 管理等核心机制;
3、熟悉 CUDA 或昇腾 CANN 开发,有算子级优化经验者优先;
4、具备模型服务化与高并发架构设计经验,熟悉流式推理、流量管控等策略;
5、熟练使用 Nsight Systems, PyTorch Profiler 等性能分析工具进行瓶颈分析;
6、熟悉 Linux 环境,具备较强的问题排查能力,能独立定位崩溃、性能瓶颈、硬件兼容性问题;
7、有在 A100/H100 / 昇腾 910B 等硬件上部署优化百亿 / 千亿参数大模型经验者优先。
加分项:
1、有国产硬件(昇腾 / 寒武纪 / 海光等)适配与优化经验;
2、对 SGLang、vLLM 等框架有源码级修改或核心贡献;
3、具备 PD 分离 或 集群算力调度优化 经验;
4、熟悉监控告警、服务可观测性体系。投递
