
华为
AI算力调度专家
AI算力调度专家
发布于 大约 3 小时前普通员工/个人贡献者
深圳市
高级经验
全职员工
仅现场办公
硕士
平台工程
Go
Npu
Rdma
分布式系统
多目标优化
异构计算
调度算法
AI 估算 · 40k–70k
华为AI核心岗位,技术门槛高,深圳薪资水平高,预估月薪4-7万,年终丰厚。
职位详情
关于这个职位
该职位负责华为AI算力调度系统的架构设计与开发,管理大规模异构算力(NPU/CPU),通过智能调度算法优化训练、推理和强化学习等场景的资源利用率和性能
你将深入Kubernetes/Slurm等调度框架,解决万卡级集群的调度挑战,是AI基础设施领域的核心技术岗位
最低要求
专业方向与研究背景:
计算机科学、分布式系统或相关专业硕士及以上学历
研究方向为分布式系统、高性能计算、操作系统、计算机体系结构,在资源调度、异构计算、多目标优化、运筹优化、存储/网络/镜像调度等领域有深入积累
知识要求:
深入理解Kubernetes调度框架(Scheduling Framework)或Slurm调度原理,有自定义调度器开发经验
熟悉主流AI芯片架构(NVIDIA/AMD/昇腾)及其性能特征,理解GPU拓扑对通信的影响
了解分布式一致性协议(Raft/Paxos)、资源分配算法(DRF/优先级抢占)
熟悉多目标优化算法(如加权和、帕累托优化、强化学习调度),了解排队论、约束满足问题等理论基础
熟悉成本模型,了解Spot实例、预留实例、按需实例的定价机制与成本优化策略
熟悉容器镜像原理(Layer、Snapshotter)、镜像分发加速技术(P2P、预热、缓存)
了解RDMA、RoCE、拥塞控制等网络基础知识
能力与经验:
年以上分布式系统或后台系统开发经验,有大规模Kubernetes/Slurm集群管理经验
调度系统经验:有自定义Kubernetes调度器或Slurm插件开发经验,熟悉调度算法(如Binpacking、碎片整理、优先级调度)
多目标优化经验:参与过多目标调度算法设计或实现,有排队时间优化、利用率提升、成本优化的实际项目经验
异构计算经验:有GPU/NPU集群调度经验,参与过异构资源池化或统一抽象项目
多场景调度经验:至少对以下场景中的两个有深入实践:大规模训练调度(万卡级)、在线推理服务调度、RL沙箱环境调度
存储调度经验:有数据局部性调度、Checkpoint优化、分布式缓存项目经验
网络调度经验:有RDMA带宽保障、拥塞控制、网络拓扑感知调度经验
镜像调度经验:有镜像预热系统、P2P分发系统(如Dragonfly)开发经验
复杂工作流经验:有Airflow、Argo Workflows或Ray编排经验,理解DAG调度
技能要求:
精通Go/C++/Java中至少一种语言,具备高并发系统开发能力
熟练使用Kubernetes Operator/Controller开发框架,熟悉client-go、controller-runtime等
具备性能分析和调优能力,能使用pprof、火焰图等工具定位调度瓶颈
熟悉Prometheus、Grafana等监控工具,能设计调度可观测性指标
具备数据分析能力,能使用Python/R进行调度策略仿真与效果评估
工作职责
岗位职责:
调度系统架构设计:设计并实现大规模分布式调度系统,支持多代际、异构算力(NPU/CPU)的统一管理与拓扑感知调度
多目标调度策略设计:设计并实现多目标协同优化调度算法,综合考虑任务排队时长、资源利用率、算力成本等指标,实现动态平衡与自适应调度
智能调度策略实现:开发负载感知的自定义调度器插件,优化资源利用率与作业性能
多场景调度优化:
训练场景:实现拓扑感知调度(HCCS/UB总线)、RDMA网络带宽保障、数据局部性调度,优化Checkpoint读写路径
推理场景:开发镜像预热与分布式缓存策略,支持弹性扩缩容与资源超卖,保障SLO的同时提升资源复用率
RL沙箱场景:设计任务协同调度机制,动态调整模拟环境与推理实例的资源配比,优化网络通信延迟,高效管理缓冲区存储
多租户资源管理:实现配额管理、公平调度、抢占策略,保障多团队业务SLO
调度性能优化:持续优化调度吞吐、调度延迟和资源碎片,支持万卡级集群规模
优先资格
优先资质:
博士优先
在OSDI、SOSP、EuroSys、ASPLOS、SC、HPDC、INFOCOM、ICAPS等顶会发表过论文者优先
有高性能网络调优经验者优先
开源影响力:Kubernetes、YuniKorn、Volcano、KubeBatch等社区贡献者优先
以第一作者发表过调度系统、异构计算、多目标优化调度、多场景资源调度相关论文者优先
有相关技术专利者优先
AI 洞察
优缺点分析
优点
- 接触前沿的异构计算、AI基础设施技术,个人成长快
- 薪资福利有竞争力,稳定性强
- 有机会与顶尖技术专家合作
- 技术深度要求高,需要持续学习最新技术
- 内部流程可能较多,创新空间有一定限制
- 适合有深厚分布式系统背景、对AI基础设施有热情、能承受高强度工作的技术专家
缺点 / 挑战
- 华为平台大,算力调度是AI核心基础设施,技术挑战高
- 工作强度较大,可能需要应对大规模系统的复杂性和高压力
角色解读
- 向资深技术专家方向发展,成为分布式调度领域的权威
- 可转向AI基础设施架构师或技术管理岗位
- 有机会参与开源社区,提升技术影响力
- 设计并实现大规模分布式调度系统,支持多代际异构算力统一管理
- 开发多目标优化调度算法,平衡任务排队时长、资源利用率和成本
- 针对训练、推理、RL沙箱等场景定制调度策略,优化性能与资源效率
- 实现多租户资源管理、配额和抢占策略,保障业务SLO
- 精通Kubernetes或Slurm调度框架,具备自定义调度器开发能力
- 熟悉主流AI芯片架构(GPU/NPU)及网络技术(RDMA/RoCE)
- 掌握多目标优化、运筹优化等算法基础
- 精通Go/C++等语言,具备高并发系统开发经验
申请策略
- 提前了解华为AI算力相关业务(如昇腾、ModelArts)和团队技术方向
- 在简历中量化成果,如调度效率提升百分比、集群规模等
- 突出Kubernetes/Slurm调度经验,特别是自定义调度器项目
- 强调多目标优化、资源调度算法相关的实际成果
- 展示大规模集群管理经验和性能优化案例
- 如有顶会论文或开源社区贡献,务必突出
- 深入理解Kubernetes调度框架源码,练习开发调度器插件
- 学习AI芯片架构和网络拓扑,了解RDMA/RoCE技术
面试指南
- 先阐述设计思路,从需求和约束出发,再给出架构和关键模块
- 结合项目经验,用STAR法则描述情境、任务、行动和结果
- 对于算法问题,先说明模型和评价指标,再讨论取舍
- 如何设计一个支持万卡集群的调度系统?关键挑战是什么?
- 解释Kubernetes调度框架的扩展点,如何实现自定义调度器?
- 在多目标调度中,如何权衡资源利用率和任务排队延迟?
- 介绍一个你优化过的调度系统案例,具体做了什么?
- 如何实现拓扑感知调度?GPU/NPU的拓扑对性能有哪些影响?
职位点评
73
综合评分
华为AI算力调度专家,前沿技术栈,成长空间大,薪资优厚,但工作强度可能较高。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合看重技术成长和行业前景,对工作强度有一定承受力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展85
工作生活50
使命价值65
薪资福利
80较高
华为作为大型科技企业,薪资福利在业内具有竞争力,且平台稳定,但具体薪酬未在职位描述中披露。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
85较高
该岗位涉及Kubernetes、多目标优化、异构计算等前沿技术,技术深度和广度都很大,能显著提升个人专业能力,成长空间广阔。
技术前沿前沿/新兴技术
技术栈Kubernetes、Slurm、多目标优化、NPU、RDMA、Go、C++、AI芯片
业务类型ambiguous
工作生活
50较低
职位描述未提及远程或弹性工作,工作地点在深圳,华为工作节奏普遍较快,WLB可能一般,但具体需入职后了解。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
65中等
AI算力调度属于高速增长赛道,对AI产业发展有重要支撑价值,但职位本身不直接体现社会使命感,更多是技术驱动。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
华为 的其他在招职位
相似职位推荐
AI基础设施研发工程师(Sandbox / 容器化)-MiMo
小米 · 北京市AI 估算 · 25k-45kSoftware Engineer, Athena Platform Team, IS&T Ai & Data Platforms
苹果 · 上海市AI 估算 · 35k-55k微信视频号-AI Infra高级工程师-工程平台
腾讯 · 深圳市AI 估算 · 30k-55k微信WeLM-大模型研发基础设施工程师-研发效能方向(深圳、上海、广州)
腾讯 · 深圳市AI 估算 · 25k-50kAI Infrastructure Software Engineer — CosmosLab
英伟达 · 上海市AI 估算 · 40k-70k
Watch Jobs