Back to Jobs
Desay SV

AI 智算基础设施 SRE(集群可观测 / 存储治理 / 资源整合)

Desay SV
上海Full TimePosted Today
AI 智算基础设施 SRE(集群可观测 / 存储治理 / 资源整合)上海全职职位描述1.可观测与告警:使用Prometheus、Grafana等组件、搭建集群资源监控大盘和告警机制; 2.存储治理:治理分布文件系统存储、对象存储,挂载规范、目录分层、配额与容量巡检; 3.集群维护: 参与集群维护、任务调度组件、监控组件日常维护与排障修复。职位要求1.本科及以上,计算机、网络相关专业,熟练 Shell/Python;会使用 Helm、Ansible 等做组件部署与配置管理; 2.熟悉 K8s 运维:节点、Pod 资源模型、存储(PV/PVC、HostPath)、调度现象与排障; 3.熟练使用 Prometheus/Grafana:PromQL、大盘设计、告警规则与运营; 4.熟悉 NFS 与对象存储(S3/MinIO):AI 训练场景下的挂载、权限、容量与 IO 问题排查; 5.有生产 K8s 集群运维、监控平台建设或 AI 训练集群 SRE 经验。 加分项 1.Ceph、Lustre、GPFS 或大规模并行文件系统经验; 2.Elasticsearch、Loki、Jaeger 等组件部署调优; 3.智驾 / 大规模 AI 训练基础设施背景。投递
Ready to apply? You'll be taken to Desay SV's application page.
AI 智算基础设施 SRE(集群可观测 / 存储治理 / 资源整合) at Desay SV