上海Full TimePosted Today
AI 智算基础设施 SRE(集群可观测 / 存储治理 / 资源整合)上海全职职位描述1.可观测与告警:使用Prometheus、Grafana等组件、搭建集群资源监控大盘和告警机制;
2.存储治理:治理分布文件系统存储、对象存储,挂载规范、目录分层、配额与容量巡检;
3.集群维护: 参与集群维护、任务调度组件、监控组件日常维护与排障修复。职位要求1.本科及以上,计算机、网络相关专业,熟练 Shell/Python;会使用 Helm、Ansible 等做组件部署与配置管理;
2.熟悉 K8s 运维:节点、Pod 资源模型、存储(PV/PVC、HostPath)、调度现象与排障;
3.熟练使用 Prometheus/Grafana:PromQL、大盘设计、告警规则与运营;
4.熟悉 NFS 与对象存储(S3/MinIO):AI 训练场景下的挂载、权限、容量与 IO 问题排查;
5.有生产 K8s 集群运维、监控平台建设或 AI 训练集群 SRE 经验。
加分项
1.Ceph、Lustre、GPFS 或大规模并行文件系统经验;
2.Elasticsearch、Loki、Jaeger 等组件部署调优;
3.智驾 / 大规模 AI 训练基础设施背景。投递
