北京、上海Full TimeSeniorPosted Today
AI基础设施系统架构师北京、上海社招全职互联网 / 电子 / 网游职位 ID:A258951职位描述岗位职责
集群网络架构设计
负责大规模计算集群(GPU集群/分布式存储/云原生集群)的网络顶层架构设计,包括Spine-Leaf架构、无损网络(Lossless Network)、东西向流量优化方案;
针对AI训练/推理场景(A100/H100/H20集群),设计RDMA/RoCE v2或InfiniBand高性能网络方案,满足大模型训练的带宽和时延要求。
网络方案规划与交付
主导数据中心内部组网方案设计,包括网络拓扑规划、IP地址规划、VLAN/VXLAN划分、BGP/ECMP策略设计;
输出详细网络实施方案(HLD/LLD)、设备选型清单(交换机/光模块/网卡)及布线方案(铜缆/光纤/AOC/DAC)。
网络性能调优与可靠性保障
优化集群网络吞吐、时延和PFC/ECN参数,解决incast、拥塞控制等高性能网络难题;
设计网络冗余方案(MC-LAG、M-LAG、ECMP),确保集群网络99.99%可用性,制定故障自愈策略。
跨域技术协同
与服务器硬件、云原生(Kubernetes/CNI)、存储(Ceph/GPFS)团队协作,打通计算-网络-存储链路;
支持业务团队(AI算法/大数据)完成集群网络需求分析,提供技术可行性评估和成本优化建议。
技术标准化与自动化
制定集群网络建设标准规范(SOP)、网络设备准入标准和验收标准;
推动网络自动化(Ansible/Python/Netconf),实现网络配置批量下发和自动化巡检。职位要求任职要求
学历与经验
本科及以上学历,计算机、通信、网络工程等相关专业;
5年以上数据中心网络或大规模集群网络设计经验,至少主导过2个千台级服务器规模集群的组网项目。
技术能力(硬性要求)
精通数据中心网络架构:深入理解Spine-Leaf、CLOS架构,熟悉BGP、OSPF、VXLAN、EVPN等协议;
高性能网络经验:熟悉RDMA技术栈(RoCE v2/iWARP/InfiniBand),掌握PFC、ECN、QoS调优,有GPU集群(NVLink+网络)设计经验优先;
设备与工程能力:熟悉华为、H3C、Cisco、Arista、Mellanox(NVIDIA)等主流交换机配置,了解DCI互联和光通信方案;
故障排查能力:熟练使用抓包工具(Wireshark/tcpdump)、网络诊断工具,能快速定位网络抖动、丢包、拥塞等问题。
软性素质
具备优秀的方案撰写能力(PPT/Word/Visio),能向非技术背景管理层清晰汇报架构方案;
具备项目管理能力,能协调厂商、施工队和内部团队按期交付;
对AI智算、大模型训练场景有好奇心,能快速学习新技术(如CXL、DDC等新型网络架构)。职位信息部门: 计算平台研发投递
