
米哈游
LLM 网关 SRE 工程师
LLM 网关 SRE 工程师
发布于 大约 9 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
学历未注明
信息技术与基础设施
CI/CD
Go
Gpu
Llm
Npu
Slo
Sre
Vllm
监控告警
AI 估算 · 30k–50k
高级 SRE 岗位,大厂背景,AI 推理方向稀缺,薪资竞争力强。
职位详情
关于这个职位
该职位负责米哈游 LLM 网关及推理服务的稳定性保障,包括监控告警、CI/CD、故障排查和 SLO 体系搭建
需要深厚的 SRE 经验和对大模型推理服务的运维理解,适合有志于在 AI 基础设施方向深耕的技术专家
最低要求
年以上运维/SRE 经验,其中 2 年以上 LLM/AI 推理服务/大模型平台生产运维经验
深度熟悉 LLM 服务线上运维(流式、限流、Token 计量、模型路由、多模型调度等)
熟悉 Kubernetes、Prometheus/Grafana,有 LLM 监控指标设计与告警治理经验
熟悉 vLLM、Triton、SGLang 等推理引擎部署运维及常见故障处理
熟悉 CI/CD 与灰度发布,了解 GPU/NPU 推理资源特性,具备 SLO/On-call 经验
熟练使用 Go/Python/Shell,责任心强,跨团队推动力好
工作职责
负责 LLM 网关及推理服务监控告警、日志链路追踪建设,覆盖 TTFT/TPOT/流式成功率、上游错误码、Token 用量等核心指标,优化 LLM 场景告警策略
负责 LLM 网关与推理服务版本发布、CI/CD 运维,制定模型路由、回退策略、限流与超时等配置变更的灰度与回滚规范,保障发布平稳
负责网关依赖组件(缓存、元数据存储等)与推理集群稳定性运维,排查流式中断、限流打满、上游超时/过载、OOM、排队超时等问题,参与 GPU/NPU 容量治理与高可用保障
制定并落地 LLM 服务 SLO/SLI 体系,参与 P0/P1 故障响应复盘,沉淀 Runbook 与运维规范
负责限流/降级/路由切换相关配置变更、应急处置与效果验证
优先资格
有 LLM 网关 / MaaS / 推理中台稳定性 Owner 经验
熟悉模型路由、限流熔断、多租户隔离,及 vLLM/Triton 性能问题排查
有 GPU/NPU 推理集群大规模运维、P0 故障排查或 LLM 运维自动化经验
熟悉 SSE 流式场景超时/断连治理,以及缓存/数据库故障对网关可用性的影响排查
AI 洞察
优缺点分析
优点
- 身处 AI 大模型前沿领域,技术成长快,行业需求旺盛
- 米哈游资金充足,项目资源丰富,能接触大规模 GPU/NPU 集群
- 职责核心,直接影响产品体验,成就感强
- 技术栈更新快,需持续学习新推理框架和工具
- 跨团队推动复杂,需较强沟通协调能力
- 适合有扎实 SRE 基础,对 AI 推理充满热情,愿意在高压下快速成长的技术型人才
缺点 / 挑战
- On-call 压力大,需快速响应 P0 故障
角色解读
- 向 AI 基础设施架构师发展,负责大规模推理集群设计与优化
- 可转型为 MaaS 平台技术负责人,主导推理平台整体稳定性
- 积累大模型运维经验后,可转向 AI 平台研发或 SRE 管理岗
- 设计并维护 LLM 网关和推理服务的监控告警系统,确保核心指标可观测
- 负责 CI/CD 流水线和灰度发布,保障模型路由、限流等配置变更安全
- 排查流式中断、OOM、超时等稳定性问题,参与 GPU/NPU 容量规划
- 制定 SLO/SLI 体系,组织故障响应复盘,沉淀运维规范
- 精通 Kubernetes、Prometheus、Grafana 等监控和容器编排工具
- 熟悉 vLLM、Triton 等推理引擎的部署和故障排查
- 掌握 Go/Python/Shell 编程,能编写运维自动化脚本
- 具备 LLM 服务运维经验,理解流式、限流、Token 计量等概念
申请策略
- 面试前准备一个过往运维大模型服务的成功案例,详细说明问题解决过程
- 了解米哈游在 AI 方面的业务布局,展现对游戏+AI 的兴趣
- 突出 LLM/AI 推理服务的运维经历,列出具体故障排查案例
- 展示 Kubernetes、Prometheus 等工具的使用深度,最好有告警治理项目
- 强调 CI/CD 和灰度发布经验,以及 SLO/SLI 体系搭建成果
- 提前学习 vLLM、Triton 等推理引擎的部署和调优
- 掌握 GPU/NPU 资源管理基础知识,了解模型路由和限流策略
面试指南
- 使用 STAR 法则:描述场景、任务、行动、结果,突出量化指标
- 强调系统性思维:从架构视角分析根因,提出长期治理方案
- 如何设计 LLM 网关的监控指标和告警策略?
- 描述一次排查流式中断或 OOM 问题的经历
- 如何制定灰度发布和回滚策略以保证推理服务稳定?
- 解释 GPU 显存不足导致 OOM 的处理流程
- 你如何衡量 SLO 达成情况?
- 准备 LLM 推理流程的深入了解,包括 TTFT、TPOT、流式成功率等指标
职位点评
69
综合评分
高薪、前沿技术栈、超强成长性,但需接受高强度On-call和现场办公。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长和前沿领域发展的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活30
使命价值70
薪资福利
75中等
薪资水平在行业中属上游,米哈游福利优厚,但具体薪资未披露,且高强度工作可能影响稳定性感知。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
职位涉及前沿LLM技术栈,深度参与AI基础设施核心,成长空间极大。
技术前沿前沿/新兴技术
技术栈LLM、vLLM、Triton、GPU、NPU、Kubernetes
成长机会SLO/On-call经验
业务类型profit_center
工作生活
30较低
仅现场办公,且明确要求On-call,工作负荷较大,WLB一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况明确要求弹性/高强度
使命价值
70中等
米哈游在游戏+AI领域有较高影响力,职位助力AI应用落地,社会意义一般但行业前景好。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
米哈游 的其他在招职位
相似职位推荐
Watch Jobs