
小米
大模型推理引擎开发工程师(高性能算子)
大模型推理引擎开发工程师(高性能算子)
发布于 大约 14 小时前普通员工/个人贡献者
北京市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Cuda
Flashattention
Pytorch
Tensorcore
大模型推理
性能优化
算子开发
AI 估算 · 30k–50k
大模型推理优化人才稀缺,北京AI岗位薪资较高,小米平台稳定,预估月薪30-50K。
职位详情
关于这个职位
这个岗位主要负责大模型推理引擎的高性能算子开发与优化,通过CUDA、TensorCore等技术提升GPU计算效率,涉及编译优化、模型并行、低精度计算等核心技术
你将参与设计高性能算子库,支持大模型在真实场景中的高效部署,是AI底层基础设施的关键角色
适合对底层系统优化和深度学习有浓厚兴趣的工程师
最低要求
硕士及以上学历,计算机、软件工程、数学等相关专业,具备扎实计算机理论基础和丰富编程经验,在深度学习领域有深入研究与实践
精通 Python,熟练掌握至少一种深度学习框架(如 PyTorch),理解深度学习和transformer系列算法,有丰富模型开发与调优经验,能独立搭建复杂模型并优化性能
熟悉主流的并行编程以及性能优化技术,熟悉CUDA和TensorCore编程
工作职责
通过编译优化、模型并行优化、图融合、高性能算子开发、低精度计算、Memory复用、Cache优化、高并发服务请求优化等技术,打造业界领先的高性能训推引擎
设计和开发高性能算子库,研究最新的GPU计算技术和优化方法,以充分利用GPU的并行计算能力,支持大模型推理优化和部署
优先资格
有相关高性能优化经验(nsys/ncu)优先
熟悉flashattention,TransformerEngine, flashinfer等算子库, 有使用triton/tilelang等做高性能算子开发经验优先
AI 洞察
优缺点分析
优点
- 涉及底层系统优化,技术壁垒高,岗位稀缺性和市场价值显著
- 小米平台资源丰富,有大规模实际业务场景可以实践和验证
- 技术门槛高,需要掌握GPU底层架构和并行编程,学习曲线陡峭
缺点 / 挑战
- 大模型推理是当前AI最热的方向之一,技术挑战大,个人成长迅速
- 工作强度可能较大,需要紧跟前沿技术快速迭代,压力与机遇并存
- 适合对高性能计算和底层优化有强烈兴趣,具备扎实编程和数学基础,能承受技术挑战并享受突破瓶颈的工程师
角色解读
- 从算子开发工程师向AI Infra架构师发展,负责更大规模的推理系统设计
- 深入大模型推理优化领域,成为该细分方向的技术专家
- 未来可转型为技术团队负责人,带领团队攻克性能瓶颈
- 负责大模型推理引擎的高性能算子开发,使用CUDA/TensorCore优化GPU计算效率
- 参与编译优化、图融合、模型并行等优化,提升推理速度和资源利用率
- 研究并应用前沿GPU技术,支持大模型在真实业务场景中的高效部署
- 精通Python,熟练使用PyTorch等深度学习框架,理解Transformer原理
- 熟悉CUDA编程和GPU架构,掌握TensorCore、并行计算和性能优化技巧
- 了解FlashAttention、Triton等算子库,具备高性能算子开发经验者为佳
申请策略
- 准备一个完整的项目案例,详细展示从问题分析、方案设计到性能验证的全过程
- 了解小米在AI大模型领域的布局和产品应用,在面试中体现业务理解
- 突出CUDA/GPU优化项目经验,用数据量化性能提升(如延迟降低、吞吐提升)
- 强调PyTorch模型开发与调优经验,特别是Transformer相关模型的实践
- 如有FlashAttention、Triton等开源社区贡献或使用经验,务必清晰展示
- 系统学习CUDA编程和GPU架构,动手实现一些算子并对比性能
- 熟悉主流推理引擎(如vLLM、TensorRT)的优化机制,了解工业级实践
- 掌握NVIDIA Nsight等性能分析工具,学会定位性能瓶颈
面试指南
- 以具体项目为例,采用STAR法则(情境-任务-行动-结果)结构化说明
- 从原理到实践,先阐述底层概念(如GPU架构、并行模型),再结合实例说明应用
- 突出量化结果,用性能对比数据和基准测试支撑你的优化效果
- 请解释FlashAttention的原理和优化点,以及它如何减少显存消耗
- 如何利用TensorCore进行矩阵乘法加速?请说明具体步骤
- 描述一个你做过的高性能算子优化案例,如何分析瓶颈并优化?
- CUDA中的内存层次结构是怎样的?如何优化内存访问以提升性能?
- 在大模型推理中,如何平衡吞吐量和延迟?有哪些常用策略?
职位点评
65
综合评分
技术前沿、薪资竞争力强,但工作强度未知,现场办公。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、热爱底层性能优化、抗压能力强的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展85
工作生活50
使命价值70
薪资福利
55较低
JD未提及具体薪资福利,但小米作为上市公司平台稳定,综合薪酬应具有市场竞争力。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
85较高
该职位聚焦大模型推理引擎优化,涉及CUDA、TensorCore等前沿技术,技术成长空间大。
技术前沿前沿/新兴技术
技术栈CUDA、TensorCore、FlashAttention、Triton、PyTorch、大模型推理
业务类型ambiguous
工作生活
50较低
JD未涉及工作生活平衡相关信息,工作地点在北京,需现场办公。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
大模型推理是人工智能的热点方向,技术价值和行业前景较好,具有一定使命感。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
小米 的其他在招职位
相似职位推荐
Watch Jobs