miHoYo logo
米哈游
AI 推理性能优化工程师

AI 推理性能优化工程师

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
学历未注明
软件工程
Cuda
Gpu
Npu
Sglang
Tensorrt
Tensorrt-Llm
Vllm
大模型推理
性能优化

AI 估算 · 35k–60k

AI推理优化人才稀缺,米哈游薪资竞争力强,上海一线大厂水平,结合岗位要求2年以上经验,预计月薪35-60K。

职位详情

关于这个职位

该职位专注于AI模型推理性能优化,涉及LLM、CV、多模态模型在GPU/NPU硬件上的部署与调优

你将使用TensorRT、vLLM等推理引擎,通过性能建模、算子优化和硬件选型,提升推理吞吐和降低延迟
与算法团队紧密合作,推动模型最优部署落地
适合有2年以上AI推理经验的工程师

最低要求

2 年以上 AI 推理部署、模型性能优化、GPU/NPU 适配或高性能计算相关经验

熟悉至少 2 种推理引擎或框架,如 TensorRT、vLLM、Triton、SGLang、TensorRT-LLM、ONNX Runtime 等
熟悉 NVIDIA GPU 生态,包括 CUDA、cuDNN、TensorRT、NCCL,了解 A100、H100、B200 等架构差异
了解 AMD ROCm 或国产 NPU/GPU 生态,如昇腾、寒武纪、燧原、摩尔线程等,有实际适配经验优先
熟悉大模型、扩散模型、多模态模型的推理链路,有模型部署、量化、并行推理或性能调优经验
熟练使用 nsight、nvprof、perf、bpf 等性能分析工具,能够定位计算、显存、带宽、通信等性能瓶颈
具备良好的数据分析和文档输出能力,能沉淀 Benchmark 报告、性能分析报告和硬件选型建议

工作职责

负责 LLM、CV、语音、多模态等模型在不同 GPU/NPU 硬件上的推理性能测试、调优和适配

负责 NVIDIA、AMD、国产卡等多硬件平台的 Benchmark 测试,输出模型、硬件、推理引擎维度的性能对比和选型建议
基于 TensorRT、vLLM、Triton、SGLang、TensorRT-LLM 等推理引擎,开展吞吐、时延、显存、Batch、KV Cache、并行策略等优化
基于 FLOPs、显存、带宽、Batch Size、Sequence Length、计算/访存比等指标进行性能建模,定位推理瓶颈并输出优化方案
与算法团队协作,理解模型结构、算子特性和精度约束,推动模型在目标硬件上的最优部署形态落地

优先资格

有 CUDA Kernel、TensorRT Plugin、算子融合、量化部署、模型并行等实战经验

熟悉 PagedAttention、Continuous Batching、Speculative Decoding、KV Cache 优化等技术
有国产 GPU/NPU 选型、测试、适配或生产落地经验
有推理框架二次开发、开源社区贡献或性能优化技术分享经验

AI 洞察

优缺点分析

优点

  • 技术前沿:接触最新大模型推理技术和多硬件平台,积累高价值经验
  • 公司平台好:米哈游资金充足,不融资,项目稳定,技术投入大
  • 薪资优厚:AI推理优化人才稀缺,薪资具备竞争力,福利完善
  • 技术深度高:需要同时掌握算法、系统和硬件知识,学习曲线陡峭
  • 工作强度可能较大:涉及多硬件适配和性能调优,项目周期紧
  • 国产硬件生态尚不成熟,适配过程可能遇到较多兼容性问题

缺点 / 挑战

  • 适合对AI推理和性能优化有浓厚兴趣,具备扎实工程能力,喜欢挑战技术难题的工程师

角色解读

  • 向AI推理架构师方向发展,主导大规模推理系统设计与优化
  • 深入底层硬件和算子开发,成为GPU/NPU计算专家
  • 横向拓展至训练优化或全栈AI工程,提升综合竞争力
  • 负责LLM、CV等多模态模型在不同GPU/NPU上的推理性能测试与调优,找出性能瓶颈
  • 基于TensorRT、vLLM等推理引擎进行吞吐、时延、显存等优化,撰写Benchmark报告
  • 与算法团队协作,推动模型最优部署方案落地,包括量化、并行策略等
  • 精通至少2种推理引擎(如TensorRT、vLLM),熟悉NVIDIA GPU生态(CUDA、NCCL)
  • 掌握性能分析工具(nsight、perf),具备性能建模和瓶颈定位能力
  • 了解国产硬件生态(昇腾、寒武纪等),有实际适配经验优先

申请策略

  • 在面试前准备一个完整的性能优化案例,包括问题分析、优化方案和最终收益
  • 了解米哈游的AI应用场景(如游戏NPC、内容生成),思考如何与推理优化结合
  • 突出推理引擎使用经验:列出TensorRT、vLLM等具体工具和优化效果(如提升吞吐X%)
  • 展示性能分析案例:详细描述使用nsight定位瓶颈并解决的过程
  • 强调硬件适配经历:如有国产卡适配经验,单独列出
  • 补充学习PagedAttention、Continuous Batching等最新优化技术
  • 动手实践推理框架二次开发,参与开源社区贡献

面试指南

  • STAR法则:描述场景、任务、行动、结果,突出量化成果
  • 对比方法:给出多种方案并分析优缺点,展示系统思考
  • 请描述一次使用TensorRT优化模型推理性能的经历,遇到了哪些瓶颈?
  • 如何对比不同GPU在大模型推理上的性能?你会设计哪些Benchmark?
  • 解释PagedAttention的原理,为什么能减少显存占用?
  • 如果你需要在昇腾NPU上部署一个LLM,你会怎么做?
  • 复习CUDA编程和GPU架构知识,特别是A100/H100的差异
  • 准备一个从性能分析到优化的完整项目案例,包含代码和性能数据

职位点评

72
综合评分

前沿AI推理优化岗,技术成长空间大、薪资优厚,但工作强度较高、无远程弹性。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和职业发展,对高薪有期待,且能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活40
使命价值65

薪资福利

80较高

薪资水平在AI推理领域具有竞争力,米哈游福利优厚(如年终奖、补充医疗等),整体补偿性较好。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

90较高

该职位涉及前沿AI推理技术、多硬件平台和多种优化方法,技能成长空间极大,发展性动机满足度高。

技术前沿前沿/新兴技术
技术栈TensorRT、vLLM、Triton、SGLang、TensorRT-LLM、CUDA、NCCL、PagedAttention、Continuous Batching、Speculative Decoding
业务类型ambiguous

工作生活

40较低

工作地点在上海,需现场办公,未提及弹性工时或远程,且推理优化工作强度可能较高,生活化动机满足有限。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

65中等

米哈游作为游戏公司,AI推理优化直接提升产品体验,但社会影响力相对中性,行业属于游戏/娱乐,增长稳定。

行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs