北京Full TimePosted Today
大模型算力调度平台开发工程师北京社招全职技术 - 开发职位 ID:A147232职位描述1、负责 AI 算力调度平台核心服务的设计、开发与持续演进,支撑模型训练、研发调试、镜像管理、数据流转等关键场景;
2、基于 Kubernetes / Volcano 构建资源管理、项目配额、任务调度、队列治理、优先级与抢占等核心能力,持续提升 GPU 资源利用率与平台吞吐能力;
3、参与平台控制面架构设计,推动领域模型统一、接口规范升级和系统架构演进,推进 REST 向 gRPC、同步接口向异步任务、单体能力向平台化能力升级;
4、负责平台稳定性与可运维性建设,包括任务状态流转、失败重试、幂等控制、审计追踪、故障恢复及复杂线上问题排查;
5、与算法、训练平台、基础设施、运维/SRE 等团队协作,持续优化多集群资源治理、调度效率、平台稳定性和使用体验。职位要求1、本科及以上学历,计算机相关专业,3 年及以上后端或平台研发经验;
2、熟练掌握 Go 语言,具备良好的工程设计与编码能力,能够独立承担核心模块设计与实现;
3、熟悉 Kubernetes 核心原理,理解资源模型、调度链路、控制器机制;有调度系统、任务编排或平台开发经验者优先;
4、熟悉 PostgreSQL / MySQL、Redis 等常见基础组件,理解异步任务、幂等控制、重试补偿等分布式系统常见设计;
熟悉 gRPC、protobuf、RESTful API 设计,有控制面服务、平台 API 或架构升级经验者优先;
5、具备较强的 Linux 问题排查、系统分析、跨团队沟通与技术推动能力。
加分项
1、有 GPU 集群、AI Infra、训练平台、MLOps 或云原生资源治理平台相关经验;
2、有 Volcano、Kueue、Operator、Controller 或 Kubernetes 调度扩展相关经验;
3、有资源配额、优先级抢占、多租户治理、控制面建模等平台建设经验;
4、熟悉监控告警、链路追踪、成本分析等可观测体系,或有从 REST 向 gRPC、从单体向领域化演进的实际经验。投递
