HUAWEI logo
华为
昇腾计算高级技术专家

昇腾计算高级技术专家

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
专家级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Ai编译器
Cuda
Llvm
Mlir
Npu
Tvm
分布式训练
大模型推理
性能优化

AI 估算 · 50k–90k

AI底层软件栈高端人才稀缺,华为ICT平台技术领先,薪资竞争力强,资深专家级岗位回报高。

职位详情

关于这个职位

作为华为昇腾计算高级技术专家,你将负责AI底层软件栈的架构设计与迭代,包括AI编译器、Runtime、算子库和分布式通信等核心模块

岗位聚焦大模型训练/推理的性能优化,涉及LLVM/MLIR、CUDA/NPU Kernel开发等前沿技术
适合对底层性能调优有深厚热情、追求技术突破的资深工程师

最低要求

熟悉Linux系统编程、多线程高并发、内存优化、汇编与指令级调优

深耕以下任一方向且实战能力突出:编译:精通LLVM/MLIR,会IR改写、后端CodeGen
Runtime:精通推理/训练调度、内存池、显存管理等
算子:精通CUDA/NPU Kernel、GEMM优化、向量化/访存/低精度加速
分布式:精通集合通信、张量/流水线并行、通信压缩与拓扑优化
熟练使用Profiling,能独立定位算子、访存、通信、调度类瓶颈并落地优化
知识储备要求:
基础:计算机组成原理、操作系统、编译原理、存储层级与缓存机制
核心:张量计算、深度学习网络原理、正反传、量化压缩、稀疏化基础理论
进阶:高性能计算(SIMD/NEON/CUDA并行)、线性代数、数值计算、分布式深度学习原理
业务:熟悉PyTorch/TensorFlow、主流推理框架,懂大模型预训练/微调/推理全流程

工作职责

负责AI底层软件栈架构设计与迭代,涵盖AI编译器、训练/推理Runtime、高性能算子库、异构芯片(GPU/NPU/ASIC)适配、通信库及性能调试工具链

主导AI编译优化、图优化、算子融合、内存复用、代码生成、低精度编译等核心模块研发落地
深耕算子极致优化、显存调度、多卡分布式、大模型推理(KV Cache/分页/预解码)全链路性能调优,提升硬件利用率、降时延、提吞吐
跟踪MLIR/LLVM/TVM/Triton等前沿技术,完成原型验证、工程化落地与技术沉淀,输出规范、专利、开源成果
联动芯片、框架、算法、业务团队,完成软硬协同适配、模型部署与疑难问题攻坚,保障大模型训练/推理业务稳定交付

优先资格

具备异构AI芯片软硬件协同开发、模型编译部署实战经验优先

AI 洞察

优缺点分析

优点

  • 接触AI基础设施最底层、最核心的技术栈(编译器、Runtime、算子库),技术壁垒高
  • 华为ICT平台提供大规模GPU/NPU集群和真实大模型业务场景,实战机会丰富
  • 跟踪LLVM/MLIR/TVM/Triton等前沿技术,持续保持技术前沿性
  • 鼓励产出专利与开源成果,个人技术影响力容易积累
  • 岗位对综合能力要求极高,需要同时掌握编译、体系结构、并行计算和深度学习
  • 底层性能优化的容错空间小、调试难度大,需要长期深入钻研
  • 适合对AI底层技术充满热情、愿意长期深耕编译与性能优化领域的资深工程师

缺点 / 挑战

  • 华为内部流程和绩效压力可能带来一定工作强度,需要较强的自驱力

角色解读

  • 成长为AI底层软件栈领域的技术专家,主导前沿编译与性能优化技术方向
  • 可向昇腾计算架构师或技术委员会方向发展,参与芯片软硬件协同设计
  • 有机会输出专利、开源成果,提升行业影响力
  • 负责AI底层软件栈的架构设计与迭代,包括编译器、Runtime、算子库、通信库等核心模块
  • 主导AI编译优化、算子极致优化和大模型推理全链路性能调优,提升硬件利用率
  • 跟踪MLIR/LLVM/TVM/Triton等前沿技术,完成原型验证与工程落地
  • 协同芯片、框架、算法团队,解决大模型训练/推理部署中的疑难问题
  • 精通Linux系统编程、多线程高并发、内存优化和汇编级调优
  • 深入掌握LLVM/MLIR、CUDA/NPU Kernel或分布式通信等至少一个方向
  • 具备性能Profiling与瓶颈定位能力,能独立完成算子、访存、通信等优化
  • 熟悉PyTorch/TensorFlow及大模型预训练/微调/推理全流程

申请策略

  • 提前了解昇腾计算生态和MindSpore等华为AI框架,面试中展现对业务的理解
  • 准备1-2个完整的性能优化案例,从问题定位到优化落地,逻辑要清晰
  • 重点突出LLVM/MLIR、CUDA Kernel或分布式训练方向的具体项目成果,量化性能提升数据
  • 展示在大模型推理(KV Cache、显存优化)或训练加速中的实战案例
  • 如果有开源项目或专利,务必列出,体现技术影响力
  • 强调软硬协同或异构芯片适配经验,这是加分项
  • 系统复习编译原理和LLVM/MLIR框架,可以尝试写一个简单的IR Pass
  • 深入理解CUDA编程模型和GPU架构,练习算子优化和Profiling工具(如Nsight)

面试指南

  • 采用STAR法则:背景-任务-行动-结果,突出个人贡献和量化指标
  • 对于技术问题,先阐述原理,再结合项目经验说明落地过程,最后总结思考
  • 面对开放性设计题,展示系统化思维,从整体架构到核心细节逐步展开
  • 请介绍一个你用MLIR/LLVM做编译优化的项目,具体做了什么,效果如何?
  • 在一个大模型推理场景中,如何定位和优化显存瓶颈?
  • 描述一次你通过算子融合或内核改写显著提升性能的经历
  • 你对KV Cache和PagedAttention的实现原理如何理解?
  • 如果让你设计一个昇腾NPU的算子映射方案,你会考虑哪些因素?

职位点评

72
综合评分

华为AI底层软件栈高级专家岗,前沿技术栈扎实,薪资竞争力强但工作强度未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合以技术成长和前沿探索为核心驱动力、愿意在底层软件栈深耕的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展92
工作生活40
使命价值75

薪资福利

75中等

该职位为华为高级技术专家,虽然薪资未在JD中披露,但结合岗位层级和行业水准,预计薪酬具有竞争力。

薪资信号未披露(AI估算:50K-90K/月)

成长发展

92较高

岗位深度涉及AI编译、分布式、性能优化等前沿方向,技术成长空间极大,且鼓励专利和开源输出。

技术前沿前沿/新兴技术
技术栈LLVM、MLIR、TVM、Triton、CUDA、NPU、大模型推理、分布式
业务类型ambiguous

工作生活

40较低

JD未提及远程或弹性办公,也未说明WLB信息,工作地点上海,但岗位强度可能较高。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

AI基础设施是高速发展赛道,技术价值强,但岗位更偏底层技术实现,社会意义体现较间接。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs