Back to Jobs
Bambu Lab

资深运维开发工程师

Bambu Lab
上海Full TimeMid-levelPosted Today
资深运维开发工程师热招上海全职研发职位描述我们正在寻找一位兼具 稳定性治理能力 与 运维开发能力 的资深工程师,加入云端 SRE 团队,负责支撑业务增长阶段下的多云、多集群云原生基础设施稳定运行与持续优化。 你将面向业务增长带来的稳定性、性能、容量和成本挑战,参与 Kubernetes 集群治理、Elasticsearch 等关键基础组件优化、线上故障治理、容量规划和变更风险控制。同时,你也将推动自动化运维平台和工具链建设,将线上问题沉淀为平台能力、工程规范和长期机制,提升研发、数据、安全、合规等团队的协作效率。 1. 稳定性治理:负责云端基础设施及关键基础组件的稳定性建设,定位并解决线上性能瓶颈、容量风险和可用性问题,保障业务系统稳定运行; 2. 性能优化:针对 Elasticsearch 等核心组件开展性能调优、容量评估、资源治理和架构优化,提升系统吞吐、查询效率和服务可靠性; 3. 云原生基础设施:负责 Kubernetes 集群及 CNCF 云原生生态组件的日常运维、架构优化和稳定性提升,支撑并保障多个 Kubernetes 集群的可靠运行; 4. 多云平台治理:参与阿里云 ACK、AWS EKS、GCP GKE 等多云托管 Kubernetes 环境的运维、治理和优化,提升多云环境下的可观测性、弹性、成本效率和运维一致性; 5. 故障与变更管理:负责线上告警处理、故障应急、根因分析、复盘改进和生产变更管理,建立可持续的稳定性改进机制; 6. 自动化与平台建设:开发和维护自动化运维平台、工具链和流程系统,提升发布、变更、巡检、告警、权限、资源交付等环节的自动化水平; 7. 跨团队协作:与后端研发、数据、安全、合规等团队紧密协作,推动基础设施问题定位、流程规范、权限治理、合规要求和稳定性改进落地。职位要求1. 本科及以上学历,计算机、软件工程、通信、自动化或相关专业优先; 2. 具备 5 年以上运维、SRE、DevOps、平台工程或云原生基础设施相关经验,有生产环境稳定性治理经验; 3. 熟练掌握 Shell、Python、Go 中至少一种或多种语言,能够通过工程化方式建设自动化工具、平台能力和运维流程; 4. 熟悉 Kubernetes 原理及生产环境实践,了解 CNCF 云原生生态中的常见组件,如监控、日志、服务发现、网关、CI/CD、配置管理等; 5. 具备较强的线上问题定位、性能优化、故障处理、容量规划和系统性复盘能力,能够从单点问题沉淀为平台化、流程化改进; 6. 熟悉主流公有云产品和云上基础设施,具备阿里云、AWS、GCP 中一种或多种云平台的实际使用经验; 7. 具备较强的跨团队沟通和项目推动能力,能够与研发、数据、安全、合规等团队协同解决复杂问题。具备技术进取心、责任感和前瞻性,能够在业务快速变化和复杂生产环境中保持主动性和系统性思考。 加分项: 1. 有阿里云 ACK、AWS EKS、GCP GKE 等托管 Kubernetes 集群的大规模生产使用和治理经验; 2. 有多集群、大节点规模 Kubernetes 环境的容量规划、稳定性治理、可观测性建设或成本优化经验; 3. 有 Elasticsearch 集群性能优化、容量治理、故障处理、索引设计或查询性能调优经验; 4. 有 GPU 集群、AI 训练/推理基础设施、资源调度或异构算力平台运维经验; 5. 有自动化运维平台、内部开发者平台、发布平台、监控告警平台或资源交付平台建设经验; 6. 有 AI 辅助编程工具的实际使用经验,能够借助 AI 工具提升运维脚本、自动化平台和工具链的开发效率。投递
Ready to apply? You'll be taken to Bambu Lab's application page.
资深运维开发工程师 at Bambu Lab