CXMT logo
长鑫存储
AI服务器运维工程师-AI Server Operation and Maintenance Engineer(J16534)

AI服务器运维工程师-AI Server Operation and Maintenance Engineer(J16534)

发布于 大约 14 小时前

普通员工/个人贡献者

合肥市
高级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Cuda
Cudnn
Nvidia Gpu
Rdma
Saltstack
Vmware

AI 估算 · 25k–40k

合肥AI运维高级工程师,要求五年以上经验及GPU服务器专长,薪资在中部地区属较高水平,参考合肥同级别岗位。

职位详情

关于这个职位

该职位负责公司AI服务器集群的部署、运维与优化,包括高性能计算集群管理、分布式训练环境(Kubernetes、Slurm)调优及NVIDIA GPU服务器性能调试

需要与AI团队紧密协作,确保大规模模型训练和推理任务的稳定高效运行
适合有深厚Linux/Windows系统管理经验、精通GPU服务器架构和自动化运维的工程师

最低要求

教育背景与专业知识:全日制本科及以上学历,计算机相关专业,五年以上相关工作经验,优秀者可适当放宽

行业与专业经验:有半导体从业经验者优先
专业技能与资格:精通NVIDIA GPU服务器架构,熟悉CUDA、cuDNN环境配置及性能调试
熟练使用Kubernetes管理容器化AI工作负载,了解RDMA、InfiniBand高速网络技术
熟练掌握主流服务器的硬件架构、安装、调试、性能优化及故障处理
熟练掌握脚本语言,至少精通Shell、Python其中一种,至少熟悉Ansible、SaltStack其中一种,能使用脚本自动化运维工作
精通Linux、Windows等主流操作系统,精通VMware等主流虚拟化技术
具有Linux、Windows、存储、备份、项目管理等相关认证者优先
具备ITIL理念,有相关ITIL证书者优先
其他要求:工作态度踏实、认真、积极主动,具备良好的沟通、学习能力,具备强烈的责任心及团队协作精神

工作职责

高性能服务器与计算集群部署维护:负责设计、部署和维护支持AI/ML工作负载的高性能服务器和计算集群,确保其稳定性和高效性

服务器运维与应急处理:负责服务器的架构规划、运行维护、日常变更、资产管理、紧急事件应急处理等工作
分布式训练环境优化:优化分布式训练环境(如Kubernetes、Slurm集群),提升资源利用率与任务调度效率
服务器性能优化:优化服务器性能,确保高效处理大规模数据集和复杂模型训练任务
AI团队协同支持:与AI团队合作,提供硬件和基础设施支持,满足AI模型训练和推理需求
架构设计与技术评估:主导或参与系统架构设计、部署、运维等相关工作,研究和评估新技术应用,并推动适合的技术落地
基础设施标准化与自动化:负责基础设施的标准化、工具化、自动化,服从上级主管安排的其他工作

AI 洞察

优缺点分析

优点

  • 深入接触前沿AI基础设施技术,如GPU集群、分布式训练框架,技术积累扎实
  • 半导体行业稳定,公司规模大,福利待遇有保障
  • 职位要求全面,可系统性提升系统架构、自动化运维及AI协同能力
  • 工作强度可能较大,需处理紧急故障和7x24小时响应
  • 技术栈更新快,需持续学习新硬件和软件框架
  • 对经验和技能要求高,入门门槛不低
  • 适合有多年运维经验、热爱底层技术、对AI基础设施充满兴趣的工程背景求职者

缺点 / 挑战

暂无明显挑战项

角色解读

  • 可向AI基础设施架构师方向发展,主导更大规模集群设计
  • 也可横向扩展至云计算或数据中心管理领域,积累混合云经验
  • 在半导体行业深耕,成为AI算力优化专家,技术壁垒高
  • 设计并部署支持AI/ML工作负载的高性能服务器集群,确保系统稳定高效
  • 日常运维服务器,处理紧急故障,执行架构规划和资产变更
  • 优化Kubernetes和Slurm等分布式训练环境,提升资源利用率
  • 与AI团队协作,提供硬件支持,评估并引入新技术
  • 精通NVIDIA GPU服务器架构,熟悉CUDA、cuDNN环境配置与调试
  • 熟练掌握Linux/Windows系统管理及VMware虚拟化技术
  • 至少精通Shell或Python,熟悉Ansible或SaltStack自动化工具
  • 了解RDMA、InfiniBand等高速网络技术,有Kubernetes容器编排经验

申请策略

  • 面试前了解长鑫存储在AI领域的应用场景,准备1-2个集群故障案例
  • 强调动手能力和抗压能力,可适当提资表示关注稳定性和长期发展
  • 突出GPU服务器部署和性能优化的具体项目经验,如集群规模、调优效果
  • 展示自动化运维脚本开发案例,强调Shell/Python及Ansible/SaltStack的应用
  • 列出Kubernetes调度配置、Slurm集群管理及高速网络调优的实际成果
  • 若有半导体行业背景或相关认证(如ITIL、Linux认证)务必写上
  • 若对RDMA/InfiniBand不熟,可通过在线课程或实验环境快速补足
  • 深入学习NVIDIA AI Enterprise或DGX平台的管理工具,提升竞争力

面试指南

  • 对于故障类问题,使用STAR法则(情境-任务-行动-结果)清晰叙述
  • 技术优化问题,先明确目标(如减少训练时间),再分析瓶颈(网络/计算/存储),最后给出方案(如调整调度策略、更换网络协议)
  • 架构设计问题,从需求出发(规模、成本、扩展性),对比不同方案优劣,最终给出推荐并说明理由
  • 请描述一次你处理GPU服务器集群重大故障的经历
  • Kubernetes中如何优化AI训练任务的资源调度?
  • CUDA环境配置中常见的性能瓶颈有哪些?如何调试?
  • RDMA与TCP/IP在高性能计算中的差异是什么?
  • 如何设计一个高可用、可扩展的AI训练基础设施?

职位点评

68
综合评分

技术密集型AI运维岗位,前沿技术栈,薪资竞争力一般,WLB偏弱。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和职业发展的工程师,愿意在稳定行业中专注AI基础设施,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展80
工作生活50
使命价值55

薪资福利

75中等

职位要求高经验技能,合肥薪资具备竞争力,福利通常包括五险一金和年终奖,但JD中未明确具体福利。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

80较高

技术栈前沿(GPU、K8s、RDMA),能深入AI基础设施,成长空间大,但JD未明确提及培训和晋升路径。

技术前沿前沿/新兴技术
技术栈NVIDIA GPU、CUDA、cuDNN、Kubernetes、RDMA、InfiniBand、Slurm
业务类型cost_center

工作生活

50较低

仅现场办公,位置在合肥(非中心城区可能为产业园),JD未提及弹性或加班情况,工作强度可能较高。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

55较低

半导体行业稳定但非高速增长,AI基础设施支持角色对社会影响力一般,创新性主要体现在技术应用层面。

行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs