
米哈游
AI 推理平台工程师
AI 推理平台工程师
发布于 大约 14 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
仅现场办公
学历未注明
信息技术与基础设施
Cuda
Gpu
Mlops
Sglang
Vllm
推理服务
稳定性
AI 估算 · 30k–50k
米哈游作为盈利稳定的游戏大厂,AI推理平台工程师属于核心技术岗位,薪资竞争力强,预计月薪30-50K,年终一般3-5个月。
职位详情
关于这个职位
作为米哈游AI推理平台工程师,你将负责AI模型推理服务的工程化部署与生产环境稳定性保障,覆盖LLM、CV、语音等多模态模型
你将基于Docker、Kubernetes及推理框架(如vLLM、Triton)构建标准化、自动化的推理平台,并建设监控、日志、压测体系以保障SLA
与算法、SRE等团队协作,支持模型从实验到生产的落地,是AI基础设施的关键角色
最低要求
有 2 年以上后端开发、平台工程、AI 基础设施、MLOps 或推理服务部署经验
熟悉 Linux、Docker、Kubernetes、网络、负载均衡、服务发现等基础设施能力
熟悉至少一种推理服务框架或部署方式,如 Triton、vLLM、SGLang、TensorRT-LLM、FastAPI/gRPC 推理服务等
熟悉 GPU 服务器和容器化运行环境,了解 NVIDIA Driver、CUDA、Container Runtime、NCCL、显存管理和 GPU 监控
具备服务稳定性建设经验,熟悉监控告警、日志分析、压测、容量评估、灰度发布、故障应急和复盘机制
熟练掌握 Go/Python/Shell 至少一种语言,能够开发平台模块、自动化工具或运维脚本
具备较强的问题定位和跨团队协作能力,能支持算法模型从实验环境到生产环境的稳定落地
工作职责
负责 AI 模型推理服务的工程化部署和生产环境稳定性保障,覆盖 LLM、CV、语音、多模态等模型服务
负责推理平台能力建设,包括模型发布、服务编排、灰度发布、回滚、弹性扩缩容、流量治理、实例管理和资源隔离
基于 Docker、Kubernetes、Triton、vLLM、SGLang 等技术栈,推动模型服务标准化、自动化和平台化
建设推理服务监控、日志、告警、压测和性能回归体系,保障线上服务 SLA 和性能稳定性
负责推理服务线上问题排查与稳定性治理,包括资源异常、服务超时、性能抖动、显存不足、实例异常等问题定位
与算法、SRE、基础设施和业务团队协作,支持模型从实验环境到生产环境的落地
优先资格
有 AI 推理平台、模型服务平台、MLOps 平台或在线推理系统建设经验
熟悉 Prometheus、Grafana、Loki、ELK、OpenTelemetry 等可观测体系建设
有 Kubernetes GPU 调度、NVIDIA Device Plugin、MIG/MPS、RDMA/RoCE/NCCL 相关经验
有多模型混部、弹性扩缩容、流量调度、资源利用率优化或成本治理经验
有公有云或私有云 GPU/NPU 资源池运维经验
AI 洞察
优缺点分析
优点
- 米哈游是头部游戏公司,技术氛围浓厚,AI推理平台是前沿领域,能深度接触LLM等大模型部署
- 职位涉及全栈基础设施,包括Kubernetes、GPU调度、可观测性,技能积累全面
- 团队稳定,薪资福利优越,年终奖丰厚
- 需要同时掌握容器编排、推理框架、GPU运维等多个技术栈,学习曲线较陡
缺点 / 挑战
- 线上服务稳定性要求高,可能涉及On-call和应急响应,工作节奏有压力
- 与算法团队协作中需频繁沟通,对跨团队合作能力有较高要求
- 适合有2年以上后端或基础设施经验,对AI部署和稳定性有热情,喜欢挑战复杂系统问题的技术人才
角色解读
- 从推理平台工程师发展为AI基础设施架构师,负责更大规模的分布式推理系统设计
- 可横向拓展至MLOps、SRE或AI框架开发方向,成为跨领域专家
- 在米哈游内部,有机会深入游戏AI、语音、多模态等业务场景,积累垂直行业经验
- 负责AI模型推理服务的工程化部署,将LLM、CV等模型高效运行在生产环境
- 建设推理平台,实现模型发布、弹性扩缩容、灰度发布等能力,提升运维效率
- 搭建监控、日志、告警体系,保障服务SLA,处理线上性能和稳定性问题
- 与算法、SRE团队协作,推动模型从实验到生产的全流程落地
- 扎实的Linux、Docker、Kubernetes基础设施知识,能熟练进行容器编排和服务治理
- 熟悉至少一种推理框架(如vLLM、Triton),了解GPU显存管理和CUDA生态
- 具备Go/Python/Shell编程能力,能开发平台模块和自动化工具
- 有良好的稳定性建设意识,熟悉监控、压测、故障排查方法
申请策略
- 在面试中准备一个你主导过的系统稳定性问题的case,展示问题定位和解决思路
- 了解米哈游的游戏产品(如《原神》《崩坏》),思考AI在游戏中的应用场景
- 突出Kubernetes、Docker相关项目经验,强调大规模集群管理和服务编排能力
- 详细描述推理服务部署或优化经历,如使用vLLM、Triton的经验和性能调优成果
- 展示稳定性建设案例,如监控告警体系搭建、故障排查和SLA保障
- 如果缺少推理框架经验,可先学习vLLM或Triton的基本使用和原理
- 加强对Kubernetes GPU调度和NVIDIA插件(如Device Plugin、MIG)的了解
面试指南
- 对于系统设计题,先明确需求(流量、延迟、SLA),然后分模块展开:服务编排、负载均衡、弹性伸缩、监控告警
- 对于问题排查题,按照现象-定位-根因-修复-复盘的结构回答,强调日志、监控和工具的使用
- 如何设计一个高可用的AI推理服务架构?
- 请描述一次你排查Kubernetes Pod异常导致的推理服务超时的经历
- vLLM和Triton在部署大模型时各有什么优缺点?
- 如何对推理服务进行压测和容量评估?
- 当GPU显存不足时,有哪些优化策略?
- 熟悉Kubernetes调度原理,特别是GPU资源的调度机制
职位点评
76
综合评分
米哈游AI推理平台工程师,前沿技术栈、薪资优厚,但工作强度较大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和薪资回报,能接受一定程度的加班和On-call的技术人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活50
使命价值65
薪资福利
85较高
米哈游作为头部游戏公司,薪资待遇优厚,且公司盈利稳定,福利完善,补偿性动机满足度较高。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
该职位涉及前沿AI推理技术和云原生基础设施,能接触LLM部署、GPU调度等热门领域,成长空间大,发展性动机满足度很高。
技术前沿前沿/新兴技术
技术栈LLM、vLLM、Triton、Kubernetes、GPU、CUDA、MLOps
业务类型profit_center
工作生活
50较低
职位要求线上稳定性保障,可能存在On-call和加班,生活化动机满足度中等偏下。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
65中等
AI推理平台支撑游戏业务智能化,有一定技术价值,但社会影响力相对有限。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
米哈游 的其他在招职位
相似职位推荐
Watch Jobs