
长江存储
高级ModelOps工程师(基础设施与推理优化)(J14559)
高级ModelOps工程师(基础设施与推理优化)(J14559)
发布于 大约 1 小时前普通员工/个人贡献者
上海市 / 武汉市
高级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Cuda
Gpu
Nccl
Sglang
Tensorrt-Llm
Vllm
Llm推理
AI 估算 · 30k–45k
高级ModelOps工程师,掌握GPU集群和LLM推理优化,市场需求大,在上海/武汉有竞争力。
职位详情
关于这个职位
该职位负责管理长江存储的私有化GPU集群,优化LLM推理服务的性能和稳定性,并构建模型部署流水线
你将深入接触Kubernetes、GPU架构以及vLLM等推理引擎,是AI基础设施的核心角色
最低要求
计算机或相关专业本科及以上,3年以上基础设施或后端工程经验
熟悉Kubernetes及云原生生态,有GPU集群运维经验(如20+节点)
熟悉NVIDIA GPU架构及CUDA生态,了解NCCL、RDMA的基本原理
精通至少一种LLM推理引擎(vLLM/SGLang/TensorRT-LLM),有生产环境实际调优经验
了解Transformer架构及推理阶段基本特点(自回归、KV Cache、Attention)
熟悉Python及Bash,能编写自动化运维脚本
工作职责
基础设施运维保障:负责私有化GPU集群的日常运维与生命周期管理,管理Kubernetes GPU集群,搭建监控告警体系,排查GPU故障,参与容量规划与成本优化
LLM推理服务优化:生产环境推理引擎的选型与调优(vLLM/SGLang/TensorRT-LLM),熟悉量化方法,优化KV Cache管理,建立基准测试体系,实现多模型并行部署与动态扩缩容
模型部署与生命周期管理:构建模型部署流水线,管理模型版本、灰度发布、A/B测试及回滚
开发支持:协助排查推理API异常,定位问题归属
优先资格
大规模(50+ GPU节点)集群运维经验
MoE模型或多模态模型部署经验
长上下文(100K+ tokens)推理优化经验
开源推理引擎贡献者
熟悉KServe、BentoML等云原生AI平台
AI 洞察
优缺点分析
优点
- 掌握前沿的AI基础设施技术栈(GPU集群、LLM推理引擎),技能稀缺度高,市场需求强劲
- 长江存储作为大型芯片企业,平台稳定,技术资源丰富,有助于积累行业经验
- 参与核心AI平台的建设,对提升个人技术影响力有很大帮助
- 技术深度要求高,需要同时精通基础设施和AI推理,学习曲线较陡
- GPU集群运维可能涉及7×24小时值班,对工作生活平衡有一定影响
- 技术迭代快,需要持续跟进新工具和框架,保持学习状态
缺点 / 挑战
- 适合热爱底层基础设施、对GPU和AI推理有浓厚兴趣,且愿意在高压力环境中快速成长的工程师
角色解读
- 成为AI基础设施领域的专家,负责更大规模集群的架构设计和优化
- 向MLOps架构师方向发展,主导模型部署平台和工具的选型与建设
- 积累管理经验,带领运维团队,负责整个AI基础设施的规划与交付
- 负责管理公司内部的私有化GPU集群,包括Kubernetes节点调度、资源隔离和网络优化,确保基础设施稳定运行
- 对LLM推理服务进行性能调优,包括引擎选型、量化方法、KV Cache优化,并建立基准测试体系
- 构建模型部署流水线,实现从模型仓库到生产环境的自动化发布、版本管理和灰度发布
- 精通Kubernetes及云原生生态,具备GPU集群运维经验,熟悉Prometheus/Grafana监控
- 深入理解NVIDIA GPU架构、CUDA生态和NCCL/RDMA原理
- 至少精通一种LLM推理引擎(vLLM/SGLang/TensorRT-LLM),有生产环境调优经验
- 熟悉Python和Bash,能编写自动化运维脚本,了解Transformer推理原理
申请策略
- 在简历中用量化数据体现工作成果,如GPU利用率提升百分比、推理延迟降低比例
- 准备一个完整的项目案例,展示从基础设施搭建到推理优化落地的全过程
- 突出GPU集群运维的具体经验,如节点规模、遇到的故障及解决方案
- 详细描述LLM推理引擎的调优案例,包括引擎选择、量化方法、性能提升数据
- 展示Kubernetes相关项目经验,如自定义调度器、资源隔离方案
- 强调自动化运维脚本和监控系统的搭建经历
- 深入学习vLLM或TensorRT-LLM的源码和配置,掌握常用调优参数
- 补充量化技术(如FP8、INT4、AWQ)和长上下文推理优化知识
面试指南
- 对于故障排查类问题,使用STAR法则:情境、任务、行动、结果,突出分析思路和解决过程
- 对于优化类问题,先明确优化目标(延迟/吞吐),再列出具体措施,并用数据对比效果
- 请描述一次你排查GPU集群故障的经历,比如掉卡或NCCL超时
- 如何优化vLLM的吞吐和延迟?请结合具体参数说明
- Kubernetes中如何实现GPU资源的隔离和动态分配?
- 长上下文推理(100K tokens)有哪些挑战?如何优化KV Cache?
- 请介绍你参与过的模型部署流水线,包括版本管理和灰度发布策略
- 复习Kubernetes GPU管理机制(device plugin、nvidia-docker、MIG)
职位点评
53
综合评分
技术前沿、公司稳定,但WLB一般,适合技术驱动型人才。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合重视技术成长和职业发展的求职者,愿意为前沿技术投入时间精力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利50
成长发展85
工作生活45
使命价值60
薪资福利
50较低
JD未明确薪资和福利信息,但公司是大型国企背景,稳定性较强,薪资可能处于市场中等水平。
薪资信号未披露(AI估算:30K-45K/月)
成长发展
85较高
该职位技术前沿,涉及GPU集群和LLM推理优化,能深度积累AI基础设施经验,成长空间大。
技术前沿前沿/新兴技术
技术栈GPU、Kubernetes、vLLM、SGLang、TensorRT-LLM、CUDA、NCCL
业务类型ambiguous
工作生活
45较低
仅现场办公,未提及远程或弹性工时,GPU集群运维可能涉及值班,工作生活平衡一般。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
60中等
存储芯片行业属于国家战略性产业,职位支撑AI基础设施,有一定社会意义,但目标感不突出。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
长江存储 的其他在招职位
相似职位推荐
Watch Jobs