YMTC logo
长江存储
高级ModelOps工程师(基础设施与推理优化)(J14559)

高级ModelOps工程师(基础设施与推理优化)(J14559)

发布于 大约 1 小时前

普通员工/个人贡献者

上海市 / 武汉市
高级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Cuda
Gpu
Nccl
Sglang
Tensorrt-Llm
Vllm
Llm推理

AI 估算 · 30k–45k

高级ModelOps工程师,掌握GPU集群和LLM推理优化,市场需求大,在上海/武汉有竞争力。

职位详情

关于这个职位

该职位负责管理长江存储的私有化GPU集群,优化LLM推理服务的性能和稳定性,并构建模型部署流水线

你将深入接触Kubernetes、GPU架构以及vLLM等推理引擎,是AI基础设施的核心角色

最低要求

计算机或相关专业本科及以上,3年以上基础设施或后端工程经验

熟悉Kubernetes及云原生生态,有GPU集群运维经验(如20+节点)
熟悉NVIDIA GPU架构及CUDA生态,了解NCCL、RDMA的基本原理
精通至少一种LLM推理引擎(vLLM/SGLang/TensorRT-LLM),有生产环境实际调优经验
了解Transformer架构及推理阶段基本特点(自回归、KV Cache、Attention)
熟悉Python及Bash,能编写自动化运维脚本

工作职责

基础设施运维保障:负责私有化GPU集群的日常运维与生命周期管理,管理Kubernetes GPU集群,搭建监控告警体系,排查GPU故障,参与容量规划与成本优化

LLM推理服务优化:生产环境推理引擎的选型与调优(vLLM/SGLang/TensorRT-LLM),熟悉量化方法,优化KV Cache管理,建立基准测试体系,实现多模型并行部署与动态扩缩容
模型部署与生命周期管理:构建模型部署流水线,管理模型版本、灰度发布、A/B测试及回滚
开发支持:协助排查推理API异常,定位问题归属

优先资格

大规模(50+ GPU节点)集群运维经验

MoE模型或多模态模型部署经验
长上下文(100K+ tokens)推理优化经验
开源推理引擎贡献者
熟悉KServe、BentoML等云原生AI平台

AI 洞察

优缺点分析

优点

  • 掌握前沿的AI基础设施技术栈(GPU集群、LLM推理引擎),技能稀缺度高,市场需求强劲
  • 长江存储作为大型芯片企业,平台稳定,技术资源丰富,有助于积累行业经验
  • 参与核心AI平台的建设,对提升个人技术影响力有很大帮助
  • 技术深度要求高,需要同时精通基础设施和AI推理,学习曲线较陡
  • GPU集群运维可能涉及7×24小时值班,对工作生活平衡有一定影响
  • 技术迭代快,需要持续跟进新工具和框架,保持学习状态

缺点 / 挑战

  • 适合热爱底层基础设施、对GPU和AI推理有浓厚兴趣,且愿意在高压力环境中快速成长的工程师

角色解读

  • 成为AI基础设施领域的专家,负责更大规模集群的架构设计和优化
  • 向MLOps架构师方向发展,主导模型部署平台和工具的选型与建设
  • 积累管理经验,带领运维团队,负责整个AI基础设施的规划与交付
  • 负责管理公司内部的私有化GPU集群,包括Kubernetes节点调度、资源隔离和网络优化,确保基础设施稳定运行
  • 对LLM推理服务进行性能调优,包括引擎选型、量化方法、KV Cache优化,并建立基准测试体系
  • 构建模型部署流水线,实现从模型仓库到生产环境的自动化发布、版本管理和灰度发布
  • 精通Kubernetes及云原生生态,具备GPU集群运维经验,熟悉Prometheus/Grafana监控
  • 深入理解NVIDIA GPU架构、CUDA生态和NCCL/RDMA原理
  • 至少精通一种LLM推理引擎(vLLM/SGLang/TensorRT-LLM),有生产环境调优经验
  • 熟悉Python和Bash,能编写自动化运维脚本,了解Transformer推理原理

申请策略

  • 在简历中用量化数据体现工作成果,如GPU利用率提升百分比、推理延迟降低比例
  • 准备一个完整的项目案例,展示从基础设施搭建到推理优化落地的全过程
  • 突出GPU集群运维的具体经验,如节点规模、遇到的故障及解决方案
  • 详细描述LLM推理引擎的调优案例,包括引擎选择、量化方法、性能提升数据
  • 展示Kubernetes相关项目经验,如自定义调度器、资源隔离方案
  • 强调自动化运维脚本和监控系统的搭建经历
  • 深入学习vLLM或TensorRT-LLM的源码和配置,掌握常用调优参数
  • 补充量化技术(如FP8、INT4、AWQ)和长上下文推理优化知识

面试指南

  • 对于故障排查类问题,使用STAR法则:情境、任务、行动、结果,突出分析思路和解决过程
  • 对于优化类问题,先明确优化目标(延迟/吞吐),再列出具体措施,并用数据对比效果
  • 请描述一次你排查GPU集群故障的经历,比如掉卡或NCCL超时
  • 如何优化vLLM的吞吐和延迟?请结合具体参数说明
  • Kubernetes中如何实现GPU资源的隔离和动态分配?
  • 长上下文推理(100K tokens)有哪些挑战?如何优化KV Cache?
  • 请介绍你参与过的模型部署流水线,包括版本管理和灰度发布策略
  • 复习Kubernetes GPU管理机制(device plugin、nvidia-docker、MIG)

职位点评

53
综合评分

技术前沿、公司稳定,但WLB一般,适合技术驱动型人才。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合重视技术成长和职业发展的求职者,愿意为前沿技术投入时间精力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利50
成长发展85
工作生活45
使命价值60

薪资福利

50较低

JD未明确薪资和福利信息,但公司是大型国企背景,稳定性较强,薪资可能处于市场中等水平。

薪资信号未披露(AI估算:30K-45K/月)

成长发展

85较高

该职位技术前沿,涉及GPU集群和LLM推理优化,能深度积累AI基础设施经验,成长空间大。

技术前沿前沿/新兴技术
技术栈GPU、Kubernetes、vLLM、SGLang、TensorRT-LLM、CUDA、NCCL
业务类型ambiguous

工作生活

45较低

仅现场办公,未提及远程或弹性工时,GPU集群运维可能涉及值班,工作生活平衡一般。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

60中等

存储芯片行业属于国家战略性产业,职位支撑AI基础设施,有一定社会意义,但目标感不突出。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs