Xiaomi logo
小米
AI算力工程师

AI算力工程师

发布于 大约 1 小时前

普通员工/个人贡献者

武汉市 / 北京市
其它
全职员工
仅现场办公
本科
平台工程
Cuda
Go
Gpu
Megatron
Pytorch
Sglang
Volcano
大模型训练
集群调度

AI 估算 · 25k–45k

AI算力是当前风口,GPU集群管理技能稀缺,小米平台大,薪资有竞争力,一线城市岗位偏高,武汉南京略低。

职位详情

关于这个职位

该职位是小米AI算力方向的核心技术岗,主要负责GPU集群的建设和优化,支撑大模型训练与推理

你将深入探索前沿GPU技术,参与万卡级集群调度、资源池化与利用率提升,为集团AI战略提供底层算力保障
适合对高性能计算、分布式系统有浓厚兴趣的技术人才

最低要求

熟悉主流GPU训练和推理芯片,熟悉CUDA生态

熟悉Kubernetes和GPU算力管理
熟练Go/Python/C++至少一门语言
计算机相关专业,本科及以上学历

工作职责

GPU 核心能力建设:持续探索前沿 GPU 芯片的技术特性,包括国产卡适配、混合精度、模型量化、显存优化等技术,将芯片能力转化为业务竞争力,有力支撑集团 AI 战略落地

万卡集群调度与管理:基于 Kubernetes 建设和运营万卡级 GPU 集群,负责 GPU 适配、拓扑感知调度、Gang 调度、GPU 故障自愈、全链路可观测等核心能力,支撑小米自研大模型 MiMo 的训练和推理等重点业务场景
GPU 池化和利用率提升:统一纳管小米 GPU 资源,推进 GPU 调度优化、资源池化、GPU 虚拟化、训推混部等关键技术研发,持续提升全集团 GPU 资源利用率,实现技术降本增效

优先资格

有大模型训练和推理优化经验优先

有万卡集群建设和GPU利用率提升经验优先
有PyTorch/Volcano/Megatron/SGLang框架熟悉者优先

AI 洞察

优缺点分析

优点

  • 身处AI算力核心赛道,技术前沿,学习机会多
  • 小米平台大,资源丰富,有机会接触万卡级集群,提升大型分布式系统能力
  • 技能稀缺性强,薪资待遇优厚,职业发展空间大
  • 技术门槛高,需要同时掌握GPU硬件、系统调度和分布式训练多个领域
  • 技术迭代快,需要持续学习保持竞争力

缺点 / 挑战

  • 集群规模大,运维复杂度高,可能会面临高强度的工作压力
  • 对底层技术和基础设施有热情,喜欢挑战高难度的系统问题,具备较强自驱力与学习能力的技术人才

角色解读

  • 技术专家方向:深耕GPU芯片、高性能计算,成为算力基础设施领域的权威
  • 架构师方向:主导大规模集群架构设计,横向拓展至整个AI基础设施平台
  • 管理方向:晋升为团队负责人,带领算力团队支撑集团AI业务
  • 负责GPU芯片技术特性的探索与落地,包括国产卡适配、混合精度、模型量化、显存优化等,提升算力性能
  • 基于Kubernetes建设万卡级GPU集群,实现资源调度、故障自愈、可观测性,支撑大模型训练和推理
  • 推进GPU资源池化、虚拟化、训推混部等优化,提升全集团GPU利用率,降低算力成本
  • 深入理解GPU架构和CUDA生态,熟悉主流训练推理芯片
  • 精通Kubernetes和算力调度,有大规模集群管理经验更佳
  • 熟练使用Go/Python/C++,熟悉PyTorch、Volcano、Megatron、SGLang等框架

申请策略

  • 关注小米AI战略方向(如大模型MiMo),在面试中展现对业务的理解
  • 准备好项目细节,尤其是量化指标(如GPU利用率提升多少)
  • 突出GPU相关项目经验,如大模型训练优化、集群调度、显存优化等
  • 强调Kubernetes、CUDA、分布式系统等核心技能的实际应用案例
  • 展示大规模集群(如千卡/万卡)的建设和运维经验,以及性能调优成果
  • 深入熟悉Kubernetes调度框架,实践Volcano、Gang调度等插件
  • 补充大模型训练推理优化知识,掌握PyTorch、Megatron等工具的使用
  • 了解国产GPU(如寒武纪、昇腾)的适配方法,积累异构计算经验

面试指南

  • 采用STAR法则:情境-任务-行动-结果,清晰展示项目背景、个人贡献和量化结果
  • 强调系统性思维,从硬件、软件、调度等多个层面分析问题
  • 结合具体技术细节,避免泛泛而谈,展示深入理解
  • 请描述一次你优化GPU利用率的经历,具体采用了哪些技术和方法?
  • 如何设计Kubernetes调度策略以保证大模型训练的稳定性和效率?
  • 谈谈你对混合精度训练和模型量化的理解及实际应用
  • 如果GPU集群出现故障,你的排查思路和工具链是什么?
  • 复习Kubernetes调度原理、GPU虚拟化和资源池化相关技术

职位点评

76
综合评分

AI算力赛道前沿技术岗,薪资优厚、成长空间大,但工作强度较高。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和职业成长、能够适应高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活45
使命价值70

薪资福利

85较高

小米作为上市大厂,薪资福利有竞争力,该岗位属核心技术岗,薪酬在行业内处于较高水平。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

90较高

岗位涉及前沿GPU技术和万卡集群,技术成长空间巨大,且小米重视AI战略,能接触到顶尖资源和挑战。

技术前沿前沿/新兴技术
技术栈GPU、CUDA、Kubernetes、PyTorch、Volcano、Megatron、SGLang
业务类型cost_center

工作生活

45较低

多城市办公均为现场办公,未提及远程或弹性工作制,工作强度可能较大,WLB一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI算力支撑大模型发展,具有技术推动意义,但岗位更偏底层基础设施,社会价值感知间接。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs