
长鑫存储
AI服务器运维工程师-AI Server Operation and Maintenance Engineer(J16534)
AI服务器运维工程师-AI Server Operation and Maintenance Engineer(J16534)
发布于 大约 14 小时前普通员工/个人贡献者
合肥市
高级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Cuda
Cudnn
Nvidia Gpu
Rdma
Saltstack
Vmware
AI 估算 · 25k–40k
合肥AI运维高级工程师,要求五年以上经验及GPU服务器专长,薪资在中部地区属较高水平,参考合肥同级别岗位。
职位详情
关于这个职位
该职位负责公司AI服务器集群的部署、运维与优化,包括高性能计算集群管理、分布式训练环境(Kubernetes、Slurm)调优及NVIDIA GPU服务器性能调试
需要与AI团队紧密协作,确保大规模模型训练和推理任务的稳定高效运行
适合有深厚Linux/Windows系统管理经验、精通GPU服务器架构和自动化运维的工程师
最低要求
教育背景与专业知识:全日制本科及以上学历,计算机相关专业,五年以上相关工作经验,优秀者可适当放宽
行业与专业经验:有半导体从业经验者优先
专业技能与资格:精通NVIDIA GPU服务器架构,熟悉CUDA、cuDNN环境配置及性能调试
熟练使用Kubernetes管理容器化AI工作负载,了解RDMA、InfiniBand高速网络技术
熟练掌握主流服务器的硬件架构、安装、调试、性能优化及故障处理
熟练掌握脚本语言,至少精通Shell、Python其中一种,至少熟悉Ansible、SaltStack其中一种,能使用脚本自动化运维工作
精通Linux、Windows等主流操作系统,精通VMware等主流虚拟化技术
具有Linux、Windows、存储、备份、项目管理等相关认证者优先
具备ITIL理念,有相关ITIL证书者优先
其他要求:工作态度踏实、认真、积极主动,具备良好的沟通、学习能力,具备强烈的责任心及团队协作精神
工作职责
高性能服务器与计算集群部署维护:负责设计、部署和维护支持AI/ML工作负载的高性能服务器和计算集群,确保其稳定性和高效性
服务器运维与应急处理:负责服务器的架构规划、运行维护、日常变更、资产管理、紧急事件应急处理等工作
分布式训练环境优化:优化分布式训练环境(如Kubernetes、Slurm集群),提升资源利用率与任务调度效率
服务器性能优化:优化服务器性能,确保高效处理大规模数据集和复杂模型训练任务
AI团队协同支持:与AI团队合作,提供硬件和基础设施支持,满足AI模型训练和推理需求
架构设计与技术评估:主导或参与系统架构设计、部署、运维等相关工作,研究和评估新技术应用,并推动适合的技术落地
基础设施标准化与自动化:负责基础设施的标准化、工具化、自动化,服从上级主管安排的其他工作
AI 洞察
优缺点分析
优点
- 深入接触前沿AI基础设施技术,如GPU集群、分布式训练框架,技术积累扎实
- 半导体行业稳定,公司规模大,福利待遇有保障
- 职位要求全面,可系统性提升系统架构、自动化运维及AI协同能力
- 工作强度可能较大,需处理紧急故障和7x24小时响应
- 技术栈更新快,需持续学习新硬件和软件框架
- 对经验和技能要求高,入门门槛不低
- 适合有多年运维经验、热爱底层技术、对AI基础设施充满兴趣的工程背景求职者
缺点 / 挑战
暂无明显挑战项
角色解读
- 可向AI基础设施架构师方向发展,主导更大规模集群设计
- 也可横向扩展至云计算或数据中心管理领域,积累混合云经验
- 在半导体行业深耕,成为AI算力优化专家,技术壁垒高
- 设计并部署支持AI/ML工作负载的高性能服务器集群,确保系统稳定高效
- 日常运维服务器,处理紧急故障,执行架构规划和资产变更
- 优化Kubernetes和Slurm等分布式训练环境,提升资源利用率
- 与AI团队协作,提供硬件支持,评估并引入新技术
- 精通NVIDIA GPU服务器架构,熟悉CUDA、cuDNN环境配置与调试
- 熟练掌握Linux/Windows系统管理及VMware虚拟化技术
- 至少精通Shell或Python,熟悉Ansible或SaltStack自动化工具
- 了解RDMA、InfiniBand等高速网络技术,有Kubernetes容器编排经验
申请策略
- 面试前了解长鑫存储在AI领域的应用场景,准备1-2个集群故障案例
- 强调动手能力和抗压能力,可适当提资表示关注稳定性和长期发展
- 突出GPU服务器部署和性能优化的具体项目经验,如集群规模、调优效果
- 展示自动化运维脚本开发案例,强调Shell/Python及Ansible/SaltStack的应用
- 列出Kubernetes调度配置、Slurm集群管理及高速网络调优的实际成果
- 若有半导体行业背景或相关认证(如ITIL、Linux认证)务必写上
- 若对RDMA/InfiniBand不熟,可通过在线课程或实验环境快速补足
- 深入学习NVIDIA AI Enterprise或DGX平台的管理工具,提升竞争力
面试指南
- 对于故障类问题,使用STAR法则(情境-任务-行动-结果)清晰叙述
- 技术优化问题,先明确目标(如减少训练时间),再分析瓶颈(网络/计算/存储),最后给出方案(如调整调度策略、更换网络协议)
- 架构设计问题,从需求出发(规模、成本、扩展性),对比不同方案优劣,最终给出推荐并说明理由
- 请描述一次你处理GPU服务器集群重大故障的经历
- Kubernetes中如何优化AI训练任务的资源调度?
- CUDA环境配置中常见的性能瓶颈有哪些?如何调试?
- RDMA与TCP/IP在高性能计算中的差异是什么?
- 如何设计一个高可用、可扩展的AI训练基础设施?
职位点评
68
综合评分
技术密集型AI运维岗位,前沿技术栈,薪资竞争力一般,WLB偏弱。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和职业发展的工程师,愿意在稳定行业中专注AI基础设施,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展80
工作生活50
使命价值55
薪资福利
75中等
职位要求高经验技能,合肥薪资具备竞争力,福利通常包括五险一金和年终奖,但JD中未明确具体福利。
薪资信号未披露(AI估算:25K-40K/月)
成长发展
80较高
技术栈前沿(GPU、K8s、RDMA),能深入AI基础设施,成长空间大,但JD未明确提及培训和晋升路径。
技术前沿前沿/新兴技术
技术栈NVIDIA GPU、CUDA、cuDNN、Kubernetes、RDMA、InfiniBand、Slurm
业务类型cost_center
工作生活
50较低
仅现场办公,位置在合肥(非中心城区可能为产业园),JD未提及弹性或加班情况,工作强度可能较高。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
55较低
半导体行业稳定但非高速增长,AI基础设施支持角色对社会影响力一般,创新性主要体现在技术应用层面。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
长鑫存储 的其他在招职位
版图设计(J19628)
长鑫存储 · 合肥市AI 估算 · 15k-25k进度计划工程师-Scheduling Engineer(J18076)
长鑫存储 · 合肥市AI 估算 · 15k-25k扩散工艺研发工程师-TD DIFF Process Engineer(J14098)
长鑫存储 · 北京市AI 估算 · 20k-35k产品技术专家-Product Technical Expert(J17995)
长鑫存储 · 合肥市AI 估算 · 30k-50k研发量测运营工程师-TD Metrology Operation Engineer(J18678)
长鑫存储 · 合肥市AI 估算 · 20k-35k
相似职位推荐
Watch Jobs