
华为
昇腾计算高级技术专家
昇腾计算高级技术专家
发布于 大约 14 小时前普通员工/个人贡献者
上海市
专家级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Ai编译器
Cuda
Llvm
Mlir
Npu
Tvm
分布式训练
大模型推理
性能优化
AI 估算 · 50k–90k
AI底层软件栈高端人才稀缺,华为ICT平台技术领先,薪资竞争力强,资深专家级岗位回报高。
职位详情
关于这个职位
作为华为昇腾计算高级技术专家,你将负责AI底层软件栈的架构设计与迭代,包括AI编译器、Runtime、算子库和分布式通信等核心模块
岗位聚焦大模型训练/推理的性能优化,涉及LLVM/MLIR、CUDA/NPU Kernel开发等前沿技术
适合对底层性能调优有深厚热情、追求技术突破的资深工程师
最低要求
熟悉Linux系统编程、多线程高并发、内存优化、汇编与指令级调优
深耕以下任一方向且实战能力突出:编译:精通LLVM/MLIR,会IR改写、后端CodeGen
Runtime:精通推理/训练调度、内存池、显存管理等
算子:精通CUDA/NPU Kernel、GEMM优化、向量化/访存/低精度加速
分布式:精通集合通信、张量/流水线并行、通信压缩与拓扑优化
熟练使用Profiling,能独立定位算子、访存、通信、调度类瓶颈并落地优化
知识储备要求:
基础:计算机组成原理、操作系统、编译原理、存储层级与缓存机制
核心:张量计算、深度学习网络原理、正反传、量化压缩、稀疏化基础理论
进阶:高性能计算(SIMD/NEON/CUDA并行)、线性代数、数值计算、分布式深度学习原理
业务:熟悉PyTorch/TensorFlow、主流推理框架,懂大模型预训练/微调/推理全流程
工作职责
负责AI底层软件栈架构设计与迭代,涵盖AI编译器、训练/推理Runtime、高性能算子库、异构芯片(GPU/NPU/ASIC)适配、通信库及性能调试工具链
主导AI编译优化、图优化、算子融合、内存复用、代码生成、低精度编译等核心模块研发落地
深耕算子极致优化、显存调度、多卡分布式、大模型推理(KV Cache/分页/预解码)全链路性能调优,提升硬件利用率、降时延、提吞吐
跟踪MLIR/LLVM/TVM/Triton等前沿技术,完成原型验证、工程化落地与技术沉淀,输出规范、专利、开源成果
联动芯片、框架、算法、业务团队,完成软硬协同适配、模型部署与疑难问题攻坚,保障大模型训练/推理业务稳定交付
优先资格
具备异构AI芯片软硬件协同开发、模型编译部署实战经验优先
AI 洞察
优缺点分析
优点
- 接触AI基础设施最底层、最核心的技术栈(编译器、Runtime、算子库),技术壁垒高
- 华为ICT平台提供大规模GPU/NPU集群和真实大模型业务场景,实战机会丰富
- 跟踪LLVM/MLIR/TVM/Triton等前沿技术,持续保持技术前沿性
- 鼓励产出专利与开源成果,个人技术影响力容易积累
- 岗位对综合能力要求极高,需要同时掌握编译、体系结构、并行计算和深度学习
- 底层性能优化的容错空间小、调试难度大,需要长期深入钻研
- 适合对AI底层技术充满热情、愿意长期深耕编译与性能优化领域的资深工程师
缺点 / 挑战
- 华为内部流程和绩效压力可能带来一定工作强度,需要较强的自驱力
角色解读
- 成长为AI底层软件栈领域的技术专家,主导前沿编译与性能优化技术方向
- 可向昇腾计算架构师或技术委员会方向发展,参与芯片软硬件协同设计
- 有机会输出专利、开源成果,提升行业影响力
- 负责AI底层软件栈的架构设计与迭代,包括编译器、Runtime、算子库、通信库等核心模块
- 主导AI编译优化、算子极致优化和大模型推理全链路性能调优,提升硬件利用率
- 跟踪MLIR/LLVM/TVM/Triton等前沿技术,完成原型验证与工程落地
- 协同芯片、框架、算法团队,解决大模型训练/推理部署中的疑难问题
- 精通Linux系统编程、多线程高并发、内存优化和汇编级调优
- 深入掌握LLVM/MLIR、CUDA/NPU Kernel或分布式通信等至少一个方向
- 具备性能Profiling与瓶颈定位能力,能独立完成算子、访存、通信等优化
- 熟悉PyTorch/TensorFlow及大模型预训练/微调/推理全流程
申请策略
- 提前了解昇腾计算生态和MindSpore等华为AI框架,面试中展现对业务的理解
- 准备1-2个完整的性能优化案例,从问题定位到优化落地,逻辑要清晰
- 重点突出LLVM/MLIR、CUDA Kernel或分布式训练方向的具体项目成果,量化性能提升数据
- 展示在大模型推理(KV Cache、显存优化)或训练加速中的实战案例
- 如果有开源项目或专利,务必列出,体现技术影响力
- 强调软硬协同或异构芯片适配经验,这是加分项
- 系统复习编译原理和LLVM/MLIR框架,可以尝试写一个简单的IR Pass
- 深入理解CUDA编程模型和GPU架构,练习算子优化和Profiling工具(如Nsight)
面试指南
- 采用STAR法则:背景-任务-行动-结果,突出个人贡献和量化指标
- 对于技术问题,先阐述原理,再结合项目经验说明落地过程,最后总结思考
- 面对开放性设计题,展示系统化思维,从整体架构到核心细节逐步展开
- 请介绍一个你用MLIR/LLVM做编译优化的项目,具体做了什么,效果如何?
- 在一个大模型推理场景中,如何定位和优化显存瓶颈?
- 描述一次你通过算子融合或内核改写显著提升性能的经历
- 你对KV Cache和PagedAttention的实现原理如何理解?
- 如果让你设计一个昇腾NPU的算子映射方案,你会考虑哪些因素?
职位点评
72
综合评分
华为AI底层软件栈高级专家岗,前沿技术栈扎实,薪资竞争力强但工作强度未知。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合以技术成长和前沿探索为核心驱动力、愿意在底层软件栈深耕的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展92
工作生活40
使命价值75
薪资福利
75中等
该职位为华为高级技术专家,虽然薪资未在JD中披露,但结合岗位层级和行业水准,预计薪酬具有竞争力。
薪资信号未披露(AI估算:50K-90K/月)
成长发展
92较高
岗位深度涉及AI编译、分布式、性能优化等前沿方向,技术成长空间极大,且鼓励专利和开源输出。
技术前沿前沿/新兴技术
技术栈LLVM、MLIR、TVM、Triton、CUDA、NPU、大模型推理、分布式
业务类型ambiguous
工作生活
40较低
JD未提及远程或弹性办公,也未说明WLB信息,工作地点上海,但岗位强度可能较高。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
AI基础设施是高速发展赛道,技术价值强,但岗位更偏底层技术实现,社会意义体现较间接。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
华为 的其他在招职位
相似职位推荐
Watch Jobs