ZTE logo
中兴通讯
智算集群运维专家

智算集群运维专家

发布于 大约 14 小时前

普通员工/个人贡献者

中国
专家级经验
全职员工
仅现场办公
本科
IT运维
Ceph
Go
Gpu集群
Lustre
Nccl
Nvidia
Roce

AI 估算 · 35k–60k

8年+经验,高级运维专家,AI基础设施热门,薪资较高。

职位详情

关于这个职位

该职位负责大规模GPU/NPU智算集群的运维与稳定性保障,处理复杂故障,优化监控与自动化体系,与硬件厂商协同解决根因问题

适合具备8年以上数据中心运维经验、熟悉高性能计算和AI基础设施的资深技术专家

最低要求

基本条件

全日制本科及以上学历,计算机、网络工程、电子信息、自动化等相关专业
年以上大型数据中心或云计算平台运维经验,其中至少最近2年以上大规模GPU智算集群或HPC集群的一线运维经验
核心技术能力
硬件与系统:精通Linux系统管理与内核调优,熟悉主流GPU服务器(如NVIDIA DGX、浪潮、华为等)硬件架构,能独立诊断处理服务器主板、内存、GPU卡(含显存错误、NVLINK降级)、PCIe链路等硬件故障
网络与存储:深入理解InfiniBand或RoCEv2高速网络协议,具备处理网络拥塞、丢包等问题的实战经验
熟悉分布式存储(如Ceph、Lustre)的运维与调优
调度与容器:精通Kubernetes或Slurm算力调度平台的部署、运维与策略配置
熟悉容器化技术,能解决GPU透传、RDMA网络插件等容器化部署难题
自动化与脚本:熟练掌握Shell、Python或Go,具备独立开发自动化运维脚本及工具的能力
综合素质
独立作战与问题解决能力:具备极强的责任心与抗压能力,能在高压环境下快速响应并独立解决复杂技术问题
风险意识与文档能力:具备敏锐的风险预判意识,擅长编写故障处理报告、应急预案及运维SOP规范文档
沟通与协作:具备与厂商进行技术博弈的能力,能基于底层日志输出清晰的故障证据链,推动外部资源高效解决问题

工作职责

智算集群独立运维与稳定性保障(核心职责)

负责大规模异构算力集群(包括GPU/NPU服务器、InfiniBand/RoCE高速网络、并行存储系统)的7×24小时日常运维、巡检与容量管理,对集群整体可用性(SLA)负责
独立处理集群层面的复杂故障,快速响应并解决GPU掉卡、节点宕机、集群瘫痪、网络拥塞导致训练中断等重大问题,具备独立进行硬件级故障诊断与固件升级的能力
风险预防与深度优化
主导制定并完善集群的应急预案、风险排查机制和标准操作流程(SOP),通过巡检数据分析和主动运维,提前发现并消除潜在的系统性风险
持续优化智算监控体系(如Prometheus+Grafana),对GPU利用率、温度、功耗、网络流量等全链路指标进行深度分析,编制专业分析报告并提出落地优化方案
自动化运维体系建设
利用Shell、Python或Go等语言开发自动化运维工具与脚本,实现集群批量部署、配置管理、故障自愈、日志分析等日常运维工作的平台化与自动化,提升运维效率
参与算力调度系统(Slurm、Kubernetes)的运维与调优,优化资源调度策略,提升算力利用率和任务吞吐量
技术攻坚与协同
在重大故障处理中,作为甲方或业务侧的技术主导,与硬件厂商、IDC机房及研发团队高效协同,精准划定故障边界,推动问题根因修复,而非临时规避
负责GPU服务器驱动、CUDA环境、NCCL通信库以及容器化环境(Docker/K8s)的配置、调优与版本管理

优先资格

加分项

持有NVIDIA(如NCA)、华为、红帽等厂商相关认证证书者优先
拥有万卡级AI集群建设或运维经验者优先
熟悉国产GPU(如华为昇腾、摩尔线程)生态与运维者优先
具备AI大模型训练框架(PyTorch/TensorFlow)分布式训练调优经验者优先

AI 洞察

优缺点分析

优点

  • 身处AI算力核心领域,技术前沿且需求旺盛,技能积累极具市场价值
  • 中兴通讯作为大厂,平台资源丰富,可接触万卡级集群和多种硬件生态
  • 工作自主性高,能主导运维体系和自动化建设,提升综合技术能力
  • 技术栈广且深,需持续学习GPU、网络、分布式系统等知识,学习成本高
  • 可能需要在节假日/夜间值班,对个人生活平衡有一定影响
  • 适合具备深厚基础设施运维经验、热爱攻克复杂技术故障、能承受高压并追求技术深耕的资深工程师

缺点 / 挑战

  • ×24小时运维压力大,需随时响应重大故障,工作节奏紧张

角色解读

  • 向智算基础设施架构师或运维专家方向发展,负责更大规模集群的设计与优化
  • 可转型AI平台工程或SRE Leader,管理运维团队,主导自动化运维体系
  • 随着AI算力需求持续增长,该领域人才稀缺,职业前景广阔
  • 负责大规模GPU/NPU智算集群的日常运维、巡检和容量管理,确保集群高可用
  • 独立处理GPU掉卡、节点宕机、网络拥塞等重大故障,进行硬件级诊断和固件升级
  • 开发自动化运维工具,优化监控体系和资源调度,提升集群利用率
  • 与硬件厂商和研发团队协同,推动根因修复,优化GPU驱动、CUDA环境等
  • 精通Linux系统管理和内核调优,熟悉GPU服务器硬件架构和故障诊断
  • 深入理解InfiniBand/RoCEv2网络协议和分布式存储(Ceph/Lustre)运维
  • 熟练Kubernetes或Slurm调度平台,掌握容器化及GPU透传、RDMA配置
  • 具备Shell/Python/Go开发能力,能独立编写自动化运维脚本和工具

申请策略

  • 了解中兴通讯智算业务布局和公司内部技术栈,在面试中展现匹配度
  • 准备一个完整的故障处理故事,包含根因分析、解决过程和总结反思
  • 突出大规模GPU集群或HPC集群的一线运维经验和具体故障处理案例
  • 强调自动化运维能力,如开发的工具、提升的效率数据
  • 展示对高速网络、存储、调度系统的深入理解及相关认证
  • 若未接触过国产GPU生态,可提前了解华为昇腾、摩尔线程等平台
  • 深入学习Slurm和Kubernetes调度策略,掌握GPU虚拟化、RDMA网络插件配置
  • 熟悉Prometheus告警规则和Grafana大盘设计,提升监控分析能力

面试指南

  • 使用STAR法则(情境、任务、行动、结果)描述故障处理案例,突出你的技术决策和影响
  • 针对技术问题,从原理入手,分层分析(硬件、网络、调度),展示系统性思维
  • 强调数据驱动的运维方法,用监控指标和日志证据支撑你的方案
  • 描述一次你独立处理GPU集群重大故障的经历
  • 如何优化InfiniBand网络以减少拥塞和丢包?
  • 谈谈你对Kubernetes调度GPU任务的理解和调优经验
  • 如何设计一套自动化的集群巡检和自愈系统?
  • 面对厂商不配合解决硬件问题时,你如何推动问题的解决?

职位点评

60
综合评分

前沿技术、强成长性,但7×24小时高压运维,适合技术狂热者。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术成长、能承受高压力、对AI基础设施有热情的资深运维专家。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展85
工作生活20
使命价值70

薪资福利

60中等

职位薪资未在JD中说明,但基于8年经验和专家级要求,薪酬应处于市场高位,但具体福利未知。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

85较高

该职位涉及GPU集群、高速网络、自动化运维等前沿技术,能显著提升个人技术深度和广度,但JD未明确晋升机制。

技术前沿前沿/新兴技术
技术栈GPU、NPU、InfiniBand、RoCEv2、Kubernetes、Slurm、Ceph、Lustre、Prometheus、Grafana、Shell、Python、Go、Docker、NCCL
业务类型cost_center

工作生活

20较低

岗位要求7×24小时运维和高压响应,对工作生活平衡影响较大。

工作模式仅现场办公
办公地点未明确
加班情况明确要求弹性/高强度

使命价值

70中等

智算集群助力AI发展,行业前景好,但岗位本身偏向技术支撑,社会直接影响力有限。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs