HUAWEI logo
华为
AI算力调度专家

AI算力调度专家

发布于 大约 3 小时前

普通员工/个人贡献者

深圳市
高级经验
全职员工
仅现场办公
硕士
平台工程
Go
Npu
Rdma
分布式系统
多目标优化
异构计算
调度算法

AI 估算 · 40k–70k

华为AI核心岗位,技术门槛高,深圳薪资水平高,预估月薪4-7万,年终丰厚。

职位详情

关于这个职位

该职位负责华为AI算力调度系统的架构设计与开发,管理大规模异构算力(NPU/CPU),通过智能调度算法优化训练、推理和强化学习等场景的资源利用率和性能

你将深入Kubernetes/Slurm等调度框架,解决万卡级集群的调度挑战,是AI基础设施领域的核心技术岗位

最低要求

专业方向与研究背景:

计算机科学、分布式系统或相关专业硕士及以上学历
研究方向为分布式系统、高性能计算、操作系统、计算机体系结构,在资源调度、异构计算、多目标优化、运筹优化、存储/网络/镜像调度等领域有深入积累
知识要求:
深入理解Kubernetes调度框架(Scheduling Framework)或Slurm调度原理,有自定义调度器开发经验
熟悉主流AI芯片架构(NVIDIA/AMD/昇腾)及其性能特征,理解GPU拓扑对通信的影响
了解分布式一致性协议(Raft/Paxos)、资源分配算法(DRF/优先级抢占)
熟悉多目标优化算法(如加权和、帕累托优化、强化学习调度),了解排队论、约束满足问题等理论基础
熟悉成本模型,了解Spot实例、预留实例、按需实例的定价机制与成本优化策略
熟悉容器镜像原理(Layer、Snapshotter)、镜像分发加速技术(P2P、预热、缓存)
了解RDMA、RoCE、拥塞控制等网络基础知识
能力与经验:
年以上分布式系统或后台系统开发经验,有大规模Kubernetes/Slurm集群管理经验
调度系统经验:有自定义Kubernetes调度器或Slurm插件开发经验,熟悉调度算法(如Binpacking、碎片整理、优先级调度)
多目标优化经验:参与过多目标调度算法设计或实现,有排队时间优化、利用率提升、成本优化的实际项目经验
异构计算经验:有GPU/NPU集群调度经验,参与过异构资源池化或统一抽象项目
多场景调度经验:至少对以下场景中的两个有深入实践:大规模训练调度(万卡级)、在线推理服务调度、RL沙箱环境调度
存储调度经验:有数据局部性调度、Checkpoint优化、分布式缓存项目经验
网络调度经验:有RDMA带宽保障、拥塞控制、网络拓扑感知调度经验
镜像调度经验:有镜像预热系统、P2P分发系统(如Dragonfly)开发经验
复杂工作流经验:有Airflow、Argo Workflows或Ray编排经验,理解DAG调度
技能要求:
精通Go/C++/Java中至少一种语言,具备高并发系统开发能力
熟练使用Kubernetes Operator/Controller开发框架,熟悉client-go、controller-runtime等
具备性能分析和调优能力,能使用pprof、火焰图等工具定位调度瓶颈
熟悉Prometheus、Grafana等监控工具,能设计调度可观测性指标
具备数据分析能力,能使用Python/R进行调度策略仿真与效果评估

工作职责

岗位职责:

调度系统架构设计:设计并实现大规模分布式调度系统,支持多代际、异构算力(NPU/CPU)的统一管理与拓扑感知调度
多目标调度策略设计:设计并实现多目标协同优化调度算法,综合考虑任务排队时长、资源利用率、算力成本等指标,实现动态平衡与自适应调度
智能调度策略实现:开发负载感知的自定义调度器插件,优化资源利用率与作业性能
多场景调度优化:
训练场景:实现拓扑感知调度(HCCS/UB总线)、RDMA网络带宽保障、数据局部性调度,优化Checkpoint读写路径
推理场景:开发镜像预热与分布式缓存策略,支持弹性扩缩容与资源超卖,保障SLO的同时提升资源复用率
RL沙箱场景:设计任务协同调度机制,动态调整模拟环境与推理实例的资源配比,优化网络通信延迟,高效管理缓冲区存储
多租户资源管理:实现配额管理、公平调度、抢占策略,保障多团队业务SLO
调度性能优化:持续优化调度吞吐、调度延迟和资源碎片,支持万卡级集群规模

优先资格

优先资质:

博士优先
在OSDI、SOSP、EuroSys、ASPLOS、SC、HPDC、INFOCOM、ICAPS等顶会发表过论文者优先
有高性能网络调优经验者优先
开源影响力:Kubernetes、YuniKorn、Volcano、KubeBatch等社区贡献者优先
以第一作者发表过调度系统、异构计算、多目标优化调度、多场景资源调度相关论文者优先
有相关技术专利者优先

AI 洞察

优缺点分析

优点

  • 接触前沿的异构计算、AI基础设施技术,个人成长快
  • 薪资福利有竞争力,稳定性强
  • 有机会与顶尖技术专家合作
  • 技术深度要求高,需要持续学习最新技术
  • 内部流程可能较多,创新空间有一定限制
  • 适合有深厚分布式系统背景、对AI基础设施有热情、能承受高强度工作的技术专家

缺点 / 挑战

  • 华为平台大,算力调度是AI核心基础设施,技术挑战高
  • 工作强度较大,可能需要应对大规模系统的复杂性和高压力

角色解读

  • 向资深技术专家方向发展,成为分布式调度领域的权威
  • 可转向AI基础设施架构师或技术管理岗位
  • 有机会参与开源社区,提升技术影响力
  • 设计并实现大规模分布式调度系统,支持多代际异构算力统一管理
  • 开发多目标优化调度算法,平衡任务排队时长、资源利用率和成本
  • 针对训练、推理、RL沙箱等场景定制调度策略,优化性能与资源效率
  • 实现多租户资源管理、配额和抢占策略,保障业务SLO
  • 精通Kubernetes或Slurm调度框架,具备自定义调度器开发能力
  • 熟悉主流AI芯片架构(GPU/NPU)及网络技术(RDMA/RoCE)
  • 掌握多目标优化、运筹优化等算法基础
  • 精通Go/C++等语言,具备高并发系统开发经验

申请策略

  • 提前了解华为AI算力相关业务(如昇腾、ModelArts)和团队技术方向
  • 在简历中量化成果,如调度效率提升百分比、集群规模等
  • 突出Kubernetes/Slurm调度经验,特别是自定义调度器项目
  • 强调多目标优化、资源调度算法相关的实际成果
  • 展示大规模集群管理经验和性能优化案例
  • 如有顶会论文或开源社区贡献,务必突出
  • 深入理解Kubernetes调度框架源码,练习开发调度器插件
  • 学习AI芯片架构和网络拓扑,了解RDMA/RoCE技术

面试指南

  • 先阐述设计思路,从需求和约束出发,再给出架构和关键模块
  • 结合项目经验,用STAR法则描述情境、任务、行动和结果
  • 对于算法问题,先说明模型和评价指标,再讨论取舍
  • 如何设计一个支持万卡集群的调度系统?关键挑战是什么?
  • 解释Kubernetes调度框架的扩展点,如何实现自定义调度器?
  • 在多目标调度中,如何权衡资源利用率和任务排队延迟?
  • 介绍一个你优化过的调度系统案例,具体做了什么?
  • 如何实现拓扑感知调度?GPU/NPU的拓扑对性能有哪些影响?

职位点评

73
综合评分

华为AI算力调度专家,前沿技术栈,成长空间大,薪资优厚,但工作强度可能较高。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合看重技术成长和行业前景,对工作强度有一定承受力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活50
使命价值65

薪资福利

80较高

华为作为大型科技企业,薪资福利在业内具有竞争力,且平台稳定,但具体薪酬未在职位描述中披露。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

85较高

该岗位涉及Kubernetes、多目标优化、异构计算等前沿技术,技术深度和广度都很大,能显著提升个人专业能力,成长空间广阔。

技术前沿前沿/新兴技术
技术栈Kubernetes、Slurm、多目标优化、NPU、RDMA、Go、C++、AI芯片
业务类型ambiguous

工作生活

50较低

职位描述未提及远程或弹性工作,工作地点在深圳,华为工作节奏普遍较快,WLB可能一般,但具体需入职后了解。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

AI算力调度属于高速增长赛道,对AI产业发展有重要支撑价值,但职位本身不直接体现社会使命感,更多是技术驱动。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs