Xiaomi logo
小米
大模型推理引擎开发工程师(高性能算子)

大模型推理引擎开发工程师(高性能算子)

发布于 大约 14 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Cuda
Flashattention
Pytorch
Tensorcore
大模型推理
性能优化
算子开发

AI 估算 · 30k–50k

大模型推理优化人才稀缺,北京AI岗位薪资较高,小米平台稳定,预估月薪30-50K。

职位详情

关于这个职位

这个岗位主要负责大模型推理引擎的高性能算子开发与优化,通过CUDA、TensorCore等技术提升GPU计算效率,涉及编译优化、模型并行、低精度计算等核心技术

你将参与设计高性能算子库,支持大模型在真实场景中的高效部署,是AI底层基础设施的关键角色
适合对底层系统优化和深度学习有浓厚兴趣的工程师

最低要求

硕士及以上学历,计算机、软件工程、数学等相关专业,具备扎实计算机理论基础和丰富编程经验,在深度学习领域有深入研究与实践

精通 Python,熟练掌握至少一种深度学习框架(如 PyTorch),理解深度学习和transformer系列算法,有丰富模型开发与调优经验,能独立搭建复杂模型并优化性能
熟悉主流的并行编程以及性能优化技术,熟悉CUDA和TensorCore编程

工作职责

通过编译优化、模型并行优化、图融合、高性能算子开发、低精度计算、Memory复用、Cache优化、高并发服务请求优化等技术,打造业界领先的高性能训推引擎

设计和开发高性能算子库,研究最新的GPU计算技术和优化方法,以充分利用GPU的并行计算能力,支持大模型推理优化和部署

优先资格

有相关高性能优化经验(nsys/ncu)优先

熟悉flashattention,TransformerEngine, flashinfer等算子库, 有使用triton/tilelang等做高性能算子开发经验优先

AI 洞察

优缺点分析

优点

  • 涉及底层系统优化,技术壁垒高,岗位稀缺性和市场价值显著
  • 小米平台资源丰富,有大规模实际业务场景可以实践和验证
  • 技术门槛高,需要掌握GPU底层架构和并行编程,学习曲线陡峭

缺点 / 挑战

  • 大模型推理是当前AI最热的方向之一,技术挑战大,个人成长迅速
  • 工作强度可能较大,需要紧跟前沿技术快速迭代,压力与机遇并存
  • 适合对高性能计算和底层优化有强烈兴趣,具备扎实编程和数学基础,能承受技术挑战并享受突破瓶颈的工程师

角色解读

  • 从算子开发工程师向AI Infra架构师发展,负责更大规模的推理系统设计
  • 深入大模型推理优化领域,成为该细分方向的技术专家
  • 未来可转型为技术团队负责人,带领团队攻克性能瓶颈
  • 负责大模型推理引擎的高性能算子开发,使用CUDA/TensorCore优化GPU计算效率
  • 参与编译优化、图融合、模型并行等优化,提升推理速度和资源利用率
  • 研究并应用前沿GPU技术,支持大模型在真实业务场景中的高效部署
  • 精通Python,熟练使用PyTorch等深度学习框架,理解Transformer原理
  • 熟悉CUDA编程和GPU架构,掌握TensorCore、并行计算和性能优化技巧
  • 了解FlashAttention、Triton等算子库,具备高性能算子开发经验者为佳

申请策略

  • 准备一个完整的项目案例,详细展示从问题分析、方案设计到性能验证的全过程
  • 了解小米在AI大模型领域的布局和产品应用,在面试中体现业务理解
  • 突出CUDA/GPU优化项目经验,用数据量化性能提升(如延迟降低、吞吐提升)
  • 强调PyTorch模型开发与调优经验,特别是Transformer相关模型的实践
  • 如有FlashAttention、Triton等开源社区贡献或使用经验,务必清晰展示
  • 系统学习CUDA编程和GPU架构,动手实现一些算子并对比性能
  • 熟悉主流推理引擎(如vLLM、TensorRT)的优化机制,了解工业级实践
  • 掌握NVIDIA Nsight等性能分析工具,学会定位性能瓶颈

面试指南

  • 以具体项目为例,采用STAR法则(情境-任务-行动-结果)结构化说明
  • 从原理到实践,先阐述底层概念(如GPU架构、并行模型),再结合实例说明应用
  • 突出量化结果,用性能对比数据和基准测试支撑你的优化效果
  • 请解释FlashAttention的原理和优化点,以及它如何减少显存消耗
  • 如何利用TensorCore进行矩阵乘法加速?请说明具体步骤
  • 描述一个你做过的高性能算子优化案例,如何分析瓶颈并优化?
  • CUDA中的内存层次结构是怎样的?如何优化内存访问以提升性能?
  • 在大模型推理中,如何平衡吞吐量和延迟?有哪些常用策略?

职位点评

65
综合评分

技术前沿、薪资竞争力强,但工作强度未知,现场办公。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长、热爱底层性能优化、抗压能力强的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展85
工作生活50
使命价值70

薪资福利

55较低

JD未提及具体薪资福利,但小米作为上市公司平台稳定,综合薪酬应具有市场竞争力。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

85较高

该职位聚焦大模型推理引擎优化,涉及CUDA、TensorCore等前沿技术,技术成长空间大。

技术前沿前沿/新兴技术
技术栈CUDA、TensorCore、FlashAttention、Triton、PyTorch、大模型推理
业务类型ambiguous

工作生活

50较低

JD未涉及工作生活平衡相关信息,工作地点在北京,需现场办公。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

大模型推理是人工智能的热点方向,技术价值和行业前景较好,具有一定使命感。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs