Xiaomi logo
小米
大模型 AI 算力工程师

大模型 AI 算力工程师

发布于 大约 2 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
本科
系统与安全工程
Cuda
Go
Gpu
Megatron
Pytorch
Sglang
Volcano

AI 估算 · 25k–45k

AI算力工程师技术门槛高,小米大厂背景,薪资处于市场中上水平。

职位详情

关于这个职位

该职位是小米AI战略的核心技术岗,负责建设和管理万卡级GPU集群,支撑大模型MiMo的训练和推理

你将深入Kubernetes调度、GPU虚拟化、训推混部等前沿技术,持续提升资源利用率并降低成本
适合对AI基础设施和高性能计算有热情的工程师

最低要求

熟悉主流 GPU 训练和推理芯片,熟悉 CUDA 生态

熟悉 Kubernetes 和 GPU 算力管理
熟练 Go/Python/C++至少一门语言
计算机相关专业,本科及以上学历

工作职责

万卡集群调度与管理:基于 Kubernetes 建设和运营万卡级 GPU 集群,负责 GPU 适配、拓扑感知调度、Gang 调度、GPU 故障自愈、全链路可观测等核心能力,支撑小米自研大模型 MiMo 的训练和推理等重点业务场景

GPU 池化和利用率提升:统一纳管小米 GPU 资源,推进 GPU 调度优化、资源池化、GPU 虚拟化、训推混部等关键技术研发,持续提升全集团 GPU 资源利用率,实现技术降本增效
GPU 核心能力建设:持续探索前沿 GPU 芯片的技术特性,包括国产卡适配、混合精度、模型量化、显存优化等技术,将芯片能力转化为业务竞争力,有力支撑集团 AI 战略落地

优先资格

有大模型训练和推理优化经验优先

有万卡集群建设和 GPU 利用率提升经验优先
有 PyTorch/Volcano/Megatron/SGLang 框架熟悉者优先

AI 洞察

优缺点分析

优点

  • 小米AI战略核心岗位,参与自研大模型MiMo,技术影响力大
  • 接触万卡集群、GPU虚拟化等前沿技术,技能积累价值高
  • 大厂平台,薪资福利有竞争力,职业发展空间广阔
  • 工作强度可能较大,涉及7x24小时集群稳定性保障
  • 技术迭代快,需要持续学习最新GPU和调度技术
  • 跨团队协作复杂,需要与算法、业务等多方沟通

缺点 / 挑战

  • 适合对AI基础设施充满热情,喜欢挑战大规模分布式系统,并愿意深耕GPU算力优化的工程师

角色解读

  • 技术纵深发展:成为GPU集群架构或AI基础设施专家,主导更大规模的算力平台
  • 横向拓展:结合AI算法理解,转向AI系统工程师或MLOps方向
  • 管理路线:带领算力团队,负责集团AI基础设施战略规划
  • 建设和运营万卡级GPU集群,使用Kubernetes进行调度、监控和故障自愈,确保大模型训练和推理的高效稳定
  • 推进GPU资源池化、虚拟化及训推混部等技术,提升整体GPU利用率并降低成本
  • 探索前沿GPU芯片特性(如国产卡、混合精度、模型量化),将硬件能力转化为业务优势
  • 精通Kubernetes和GPU算力管理,有大规模集群运维经验
  • 熟悉CUDA生态及主流GPU芯片(NVIDIA/国产),了解大模型训练推理优化
  • 掌握Go/Python/C++至少一门语言,有PyTorch/Volcano/Megatron等框架使用经验

申请策略

  • 提前了解小米MiMo大模型的技术架构,面试中展现对业务场景的理解
  • 强调降本增效的思维,准备具体案例说明如何提升资源利用率
  • 突出大规模GPU集群建设或运维经验,提及集群规模和具体优化成果
  • 展示Kubernetes、GPU调度、CUDA编程等核心技术能力,附上项目细节
  • 如果有大模型训练/推理优化经验,重点描述性能提升百分比
  • 深入学习Kubernetes调度器扩展、GPU虚拟化技术(如vGPU)
  • 实践PyTorch分布式训练框架及Megatron/SGLang
  • 了解国产GPU(如寒武纪、昇腾)的适配和性能调优

面试指南

  • 对于设计类问题,从需求分析、架构选型、关键挑战、解决方案逐步展开,最后总结效果
  • 对于故障处理类问题,按照问题发现、根因分析、临时措施、长期预防的结构回答
  • 对于优化类问题,明确量化指标(如利用率、吞吐),说明具体技术手段和收益
  • 如何设计一个万卡级GPU集群的调度策略?
  • 请解释GPU虚拟化的实现方式及其对利用率的影响
  • 在大模型训练中遇到过哪些GPU故障?如何实现自愈?
  • 如何平衡训练和推理任务的资源分配(训推混部)?
  • 请介绍CUDA编程中优化显存使用的常用技术

职位点评

73
综合评分

大厂AI算力核心岗,前沿技术栈,薪资优厚,但现场办公且可能加班。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和职业发展,愿意在AI基础设施领域深耕,对薪资和平台有较高要求,但能接受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活40
使命价值70

薪资福利

80较高

小米是大厂,薪资有竞争力,且上市稳定,福利完善。但JD未明确薪资,具体面议。

薪资信号面议 (25K-45K/月)

成长发展

90较高

职位涉及万卡集群、GPU虚拟化等前沿技术,且小米AI战略投入大,成长空间广阔。

技术前沿前沿/新兴技术
技术栈GPU、Kubernetes、CUDA、PyTorch、Megatron、Volcano
业务类型profit_center

工作生活

40较低

工作地点北京,现场办公,未提弹性或远程。集群运维可能涉及on-call,WLB一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

AI基础设施对集团AI战略有直接支撑,社会影响力中性偏正面。技术本身有创新性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs