Xiaomi logo
小米
算法部署工程师-生态链

算法部署工程师-生态链

发布于 大约 3 小时前

普通员工/个人贡献者

武汉市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Cuda
Tensorrt
Vllm
模型压缩

AI 估算 · 20k–30k

大模型部署方向热门,技能要求高,小米平台和薪资有竞争力,武汉生活成本低,校招薪资处于市场中上水平。

职位详情

关于这个职位

该职位负责将大模型高效部署到边缘设备和云端,涉及模型压缩、推理优化和CUDA算子开发,是AI工程落地的重要环节

你将参与小米生态链的AI应用,深入学习vLLM、Triton等主流推理框架,提升系统性能优化能力
适合对底层技术有热情、追求技术深度的应届生

最低要求

届海内外应届生,计算机、AI等相关专业本科及以上学历

精通 C/C++ 与 Python,熟悉 Linux 开发环境
深入理解 Transformer 架构,熟悉 vLLM、TensorRT 等推理框架及模型压缩技术

工作职责

端侧部署加速:负责模型在边缘设备的部署,开展量化、剪枝、蒸馏及算子融合等轻量化技术的研发与工程落地

云端推理优化:基于 vLLM、Triton 等框架进行大模型推理服务的架构设计与调优,优化 KV Cache 与动态批处理,提升高并发吞吐量
底层算子开发:参与 CUDA 等高性能算子开发与图编译优化,解决显存溢出及长稳运行等工程难题

优先资格

具备 CUDA Kernel 开发、ACM 竞赛获奖或开源推理框架贡献经验者优先

AI 洞察

优缺点分析

优点

  • 处于大模型实用化最前沿,技术含金量高,经验积累极具价值
  • 小米作为大型科技公司,提供成熟平台和真实业务场景,能快速成长
  • 岗位涉及从端侧到云端的全栈部署优化,视野开阔
  • 技术难度大,需要同时掌握算法、系统、硬件等多领域知识

缺点 / 挑战

  • 工作强度可能较高,需要应对高并发、性能瓶颈等棘手问题
  • 持续学习压力大,模型和框架迭代迅速,需不断更新知识体系
  • 适合对底层系统充满好奇、热爱性能优化和挑战技术难题的应届生

角色解读

  • 可向大模型推理优化专家方向发展,深入研究模型压缩、算子优化等前沿技术
  • 有机会转向 AI 系统架构师,负责整条推理链路的设计与优化
  • 也可深入底层硬件方向,与芯片、边缘设备结合,成为AI平台核心技术骨干
  • 负责将大模型部署到边缘设备,通过量化、剪枝、蒸馏等轻量化技术优化模型性能
  • 基于 vLLM、Triton 等框架设计并调优云端推理服务,提升高并发下的吞吐量
  • 开发 CUDA 高性能算子,进行图编译优化,解决显存溢出和稳定性问题
  • 精通 C/C++ 和 Python,熟悉 Linux 开发环境,具备扎实的编程功底
  • 深入理解 Transformer 架构,熟悉 vLLM、TensorRT 等推理框架及模型压缩技术
  • 了解 CUDA Kernel 开发,具备性能调优和并行计算经验更佳

申请策略

  • 关注小米生态链的AI产品方向,在面试中展示对业务落地的理解
  • 可以准备一个端侧部署或推理加速的Demo,体现工程能力
  • 突出C/C++和Python项目经验,尤其是与模型部署或推理相关的实践
  • 如果有CUDA编程、模型压缩或并发编程的项目,重点展示细节和成果
  • 提及竞赛获奖(如ACM)或开源贡献,能显著增加竞争力
  • 提前学习vLLM、TensorRT等推理框架,动手部署一个Transformer模型
  • 了解量化和剪枝的原理,尝试用工具实现简单的模型压缩

面试指南

  • 采用‘原理-方法-实践’结构:先说明理论基础,再介绍常用技术,最后结合项目经验展示落地能力
  • 遇到不熟悉的问题,先尝试拆解问题,再基于已有知识推理,展现学习潜力
  • 如何对Transformer模型进行量化?有哪些量化方法?
  • 解释KV Cache的作用,以及如何优化它?
  • 如何在CUDA上实现一个高效的算子?
  • 描述一次你进行性能调优的经历,用了哪些工具和方法?
  • 复习模型压缩、推理加速的核心概念,如量化、蒸馏、算子融合
  • 整理一个自己最熟悉的部署项目,从模型转换到性能调优的完整链路

职位点评

76
综合评分

大厂校招、前沿大模型部署技术、薪资有竞争力,但WLB不明确。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合有强烈技术成长动机、愿意投身大模型浪潮的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活60
使命价值75

薪资福利

70中等

薪资未在JD中披露,但小米作为上市公司校招薪资通常具备竞争力,且武汉生活成本较低,整体补偿性尚可。

薪资信号未披露(AI估算:20K-30K/月)

成长发展

90较高

岗位处于大模型部署前沿,涉及vLLM、CUDA等先进技术,技术成长空间大,发展性强。

技术前沿前沿/新兴技术
技术栈C/C++、Python、vLLM、Triton、CUDA、TensorRT、Transformer、量化、剪枝
业务类型ambiguous

工作生活

60中等

工作地点为武汉,现场办公,JD未提及弹性或远程,WLB信号不明确,可能面临一定强度。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

人工智能是高速增长赛道,该岗位推动大模型实际落地,具备技术创新的意义,社会价值中等偏正面。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs