
米哈游
AI 推理性能优化工程师
AI 推理性能优化工程师
发布于 大约 14 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
仅现场办公
学历未注明
软件工程
Cuda
Gpu
Npu
Sglang
Tensorrt
Tensorrt-Llm
Vllm
大模型推理
性能优化
AI 估算 · 35k–60k
AI推理优化人才稀缺,米哈游薪资竞争力强,上海一线大厂水平,结合岗位要求2年以上经验,预计月薪35-60K。
职位详情
关于这个职位
该职位专注于AI模型推理性能优化,涉及LLM、CV、多模态模型在GPU/NPU硬件上的部署与调优
你将使用TensorRT、vLLM等推理引擎,通过性能建模、算子优化和硬件选型,提升推理吞吐和降低延迟
与算法团队紧密合作,推动模型最优部署落地
适合有2年以上AI推理经验的工程师
最低要求
有 2 年以上 AI 推理部署、模型性能优化、GPU/NPU 适配或高性能计算相关经验
熟悉至少 2 种推理引擎或框架,如 TensorRT、vLLM、Triton、SGLang、TensorRT-LLM、ONNX Runtime 等
熟悉 NVIDIA GPU 生态,包括 CUDA、cuDNN、TensorRT、NCCL,了解 A100、H100、B200 等架构差异
了解 AMD ROCm 或国产 NPU/GPU 生态,如昇腾、寒武纪、燧原、摩尔线程等,有实际适配经验优先
熟悉大模型、扩散模型、多模态模型的推理链路,有模型部署、量化、并行推理或性能调优经验
熟练使用 nsight、nvprof、perf、bpf 等性能分析工具,能够定位计算、显存、带宽、通信等性能瓶颈
具备良好的数据分析和文档输出能力,能沉淀 Benchmark 报告、性能分析报告和硬件选型建议
工作职责
负责 LLM、CV、语音、多模态等模型在不同 GPU/NPU 硬件上的推理性能测试、调优和适配
负责 NVIDIA、AMD、国产卡等多硬件平台的 Benchmark 测试,输出模型、硬件、推理引擎维度的性能对比和选型建议
基于 TensorRT、vLLM、Triton、SGLang、TensorRT-LLM 等推理引擎,开展吞吐、时延、显存、Batch、KV Cache、并行策略等优化
基于 FLOPs、显存、带宽、Batch Size、Sequence Length、计算/访存比等指标进行性能建模,定位推理瓶颈并输出优化方案
与算法团队协作,理解模型结构、算子特性和精度约束,推动模型在目标硬件上的最优部署形态落地
优先资格
有 CUDA Kernel、TensorRT Plugin、算子融合、量化部署、模型并行等实战经验
熟悉 PagedAttention、Continuous Batching、Speculative Decoding、KV Cache 优化等技术
有国产 GPU/NPU 选型、测试、适配或生产落地经验
有推理框架二次开发、开源社区贡献或性能优化技术分享经验
AI 洞察
优缺点分析
优点
- 技术前沿:接触最新大模型推理技术和多硬件平台,积累高价值经验
- 公司平台好:米哈游资金充足,不融资,项目稳定,技术投入大
- 薪资优厚:AI推理优化人才稀缺,薪资具备竞争力,福利完善
- 技术深度高:需要同时掌握算法、系统和硬件知识,学习曲线陡峭
- 工作强度可能较大:涉及多硬件适配和性能调优,项目周期紧
- 国产硬件生态尚不成熟,适配过程可能遇到较多兼容性问题
缺点 / 挑战
- 适合对AI推理和性能优化有浓厚兴趣,具备扎实工程能力,喜欢挑战技术难题的工程师
角色解读
- 向AI推理架构师方向发展,主导大规模推理系统设计与优化
- 深入底层硬件和算子开发,成为GPU/NPU计算专家
- 横向拓展至训练优化或全栈AI工程,提升综合竞争力
- 负责LLM、CV等多模态模型在不同GPU/NPU上的推理性能测试与调优,找出性能瓶颈
- 基于TensorRT、vLLM等推理引擎进行吞吐、时延、显存等优化,撰写Benchmark报告
- 与算法团队协作,推动模型最优部署方案落地,包括量化、并行策略等
- 精通至少2种推理引擎(如TensorRT、vLLM),熟悉NVIDIA GPU生态(CUDA、NCCL)
- 掌握性能分析工具(nsight、perf),具备性能建模和瓶颈定位能力
- 了解国产硬件生态(昇腾、寒武纪等),有实际适配经验优先
申请策略
- 在面试前准备一个完整的性能优化案例,包括问题分析、优化方案和最终收益
- 了解米哈游的AI应用场景(如游戏NPC、内容生成),思考如何与推理优化结合
- 突出推理引擎使用经验:列出TensorRT、vLLM等具体工具和优化效果(如提升吞吐X%)
- 展示性能分析案例:详细描述使用nsight定位瓶颈并解决的过程
- 强调硬件适配经历:如有国产卡适配经验,单独列出
- 补充学习PagedAttention、Continuous Batching等最新优化技术
- 动手实践推理框架二次开发,参与开源社区贡献
面试指南
- STAR法则:描述场景、任务、行动、结果,突出量化成果
- 对比方法:给出多种方案并分析优缺点,展示系统思考
- 请描述一次使用TensorRT优化模型推理性能的经历,遇到了哪些瓶颈?
- 如何对比不同GPU在大模型推理上的性能?你会设计哪些Benchmark?
- 解释PagedAttention的原理,为什么能减少显存占用?
- 如果你需要在昇腾NPU上部署一个LLM,你会怎么做?
- 复习CUDA编程和GPU架构知识,特别是A100/H100的差异
- 准备一个从性能分析到优化的完整项目案例,包含代码和性能数据
职位点评
72
综合评分
前沿AI推理优化岗,技术成长空间大、薪资优厚,但工作强度较高、无远程弹性。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和职业发展,对高薪有期待,且能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活40
使命价值65
薪资福利
80较高
薪资水平在AI推理领域具有竞争力,米哈游福利优厚(如年终奖、补充医疗等),整体补偿性较好。
薪资信号未披露(AI估算:35K-60K/月)
成长发展
90较高
该职位涉及前沿AI推理技术、多硬件平台和多种优化方法,技能成长空间极大,发展性动机满足度高。
技术前沿前沿/新兴技术
技术栈TensorRT、vLLM、Triton、SGLang、TensorRT-LLM、CUDA、NCCL、PagedAttention、Continuous Batching、Speculative Decoding
业务类型ambiguous
工作生活
40较低
工作地点在上海,需现场办公,未提及弹性工时或远程,且推理优化工作强度可能较高,生活化动机满足有限。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
65中等
米哈游作为游戏公司,AI推理优化直接提升产品体验,但社会影响力相对中性,行业属于游戏/娱乐,增长稳定。
行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
米哈游 的其他在招职位
相似职位推荐
Watch Jobs