AgiBot logo
智元机器人
算子开发工程师(训推底层算子 / 高性能计算方向)

算子开发工程师(训推底层算子 / 高性能计算方向)

发布于 大约 15 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Cuda
Flashattention
Mlir
Npu
Pytorch
深度学习
高性能计算

AI 估算 · 30k–60k

AI算子开发人才稀缺,上海薪资水位高,硕士2年经验预计中高位,B轮公司奖金月数适中。

职位详情

关于这个职位

该职位负责深度学习核心算子的开发与极致优化,包括Attention、矩阵乘、融合算子等,基于CUDA/Triton/MLIR实现高性能算子,支撑大模型训练与推理性能提升

你将与训练/推理团队协作,将自定义算子集成到PyTorch/vLLM等框架,并针对GPU/NPU等硬件进行性能调优
适合对底层计算和性能优化有热情的技术人才

最低要求

硕士及以上,计算机/电子/数学相关,2年+AI算子/HPC开发经验

精通C++/CUDA编程,熟悉GPU/NPU体系结构、共享内存、流水线、访存优化
熟悉Triton/CUTLASS/cuBLAS/cuDNN,有算子库开发经验优先
理解深度学习核心算子:GEMM、Conv、LayerNorm、Softmax、Attention、Quant
熟悉性能分析工具:Nsight Compute/Systems、perf、VTune

工作职责

负责Transformer/Attention/FFN、矩阵乘、融合算子、量化算子的开发与极致优化

基于CUDA/CUTLASS/Triton/MLIR开发高性能算子,支撑训练与推理性能提升
针对GPU/NPU/昇腾/寒武纪等硬件做算子适配、性能调优、软硬件协同
实现FlashAttention-2/3、FlashInfer、DeepGEMM、PagedAttention、FP8/FP4等核心算子
负责算子性能分析、瓶颈定位、显存/计算/访存优化,达到硬件算力上限
与训练/推理团队协同,将定制算子集成到PyTorch/Transformers/vllm等训练和推理框架中
构建算子测试、benchmark、自动化验证体系,保证稳定性与兼容性

优先资格

有PyTorch算子开发、自定义算子、推理引擎算子接入经验优先

具备扎实的数值计算、并行算法、汇编/IR阅读能力优先

AI 洞察

优缺点分析

优点

  • 技术前沿性高,直接接触最先进的算子优化方法(FlashAttention、FP8等),个人技术成长快
  • 智元机器人处于具身智能赛道,公司前景好,可积累行业影响力
  • 技术栈专业性强,需要持续学习最新硬件和算法,保持知识更新
  • 适合对底层计算和性能优化有极强热情、喜欢钻研技术细节、能承受高压的技术型人才

缺点 / 挑战

  • AI底层算子是算力瓶颈的关键,人才稀缺,薪资竞争力强,职业发展空间大
  • 工作强度较大,性能优化需要深入钻研和反复调试,可能面临较大压力
  • 算子开发需与多方团队协作,沟通成本较高,且结果难以量化但影响重大

角色解读

  • 技术专家路线:从算子开发工程师逐步成长为高性能计算领域的技术专家,主导核心算子库设计
  • 架构师路线:向AI芯片软件栈架构师方向发展,参与软硬件协同设计,影响下一代AI计算体系
  • 团队管理路线:积累经验后带领算子优化团队,负责整体性能优化战略
  • 负责深度学习核心算子(如Attention、GEMM)的开发与极致优化,使用CUDA/Triton/CUTLASS等工具,直接提升模型训练和推理性能
  • 针对GPU/NPU等硬件进行算子的适配和调优,深入理解硬件体系结构,实现软硬件协同优化
  • 实现关键算子库如FlashAttention、PagedAttention等,并集成到PyTorch/vLLM等主流框架中
  • 构建算子测试和基准测试体系,持续分析与优化性能瓶颈,确保算子的稳定性和兼容性
  • 精通C++/CUDA编程,熟悉GPU/NPU架构,掌握共享内存、流水线、访存优化等核心知识
  • 熟悉Triton/CUTLASS/cuBLAS/cuDNN等算子开发库,具备算子库开发经验者优先
  • 理解深度学习基础算子(GEMM/Conv/Attention等),掌握数值计算和并行算法
  • 熟练使用性能分析工具(Nsight、perf、VTune)进行瓶颈定位和优化

申请策略

  • 申请时强调对AI底层优化的热情,可附带博客或GitHub展示个人技术深度
  • 了解智元机器人的产品方向,在面试中体现对具身智能场景下算力需求的思考
  • 重点突出CUDA/C++高性能编程经验,列出具体的算子优化项目及性能提升数据
  • 展示对GPU/NPU架构的理解,如共享内存使用、访存优化技巧,以及使用过的分析工具
  • 强调掌握Triton/CUTLASS等算子库,并附上相关的代码或开源贡献
  • 如果熟悉PyTorch自定义算子或推理引擎集成,务必详细描述
  • 提前学习并实践FlashAttention-2/3或PagedAttention的原理和实现,加深对算子优化的理解
  • 熟悉昇腾或寒武纪等国产硬件生态,了解其编程模型与调优方法

面试指南

  • 用STAR法则:情境(Situation)、任务(Task)、行动(Action)、结果(Result),清晰描述项目经历
  • 针对优化类问题,从算法、访存、计算、并行度等维度系统分析,体现逻辑性
  • 先讲原理,再结合实践案例,展示对硬件底层机制的理解
  • 请介绍你使用CUDA优化过一个算子的具体案例,遇到了哪些瓶颈?如何解决的?
  • 解释FlashAttention的原理和它为什么能加速注意力计算
  • 如何优化一个GEMM算子?从哪些维度考虑?
  • 熟悉哪些性能分析工具?如何定位访存瓶颈?
  • 谈谈你对融合算子的理解,以及在实际项目中如何应用?

职位点评

72
综合评分

技术前沿、成长性强,但工作强度大,适合热爱底层性能优化的工程师。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和长期成长、对生活工作平衡要求不高、愿意在快节奏中挑战自我的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展92
工作生活45
使命价值80

薪资福利

70中等

薪资未明确披露,但公司处于B轮并聚焦热门AI赛道,整体薪资水平有竞争力,但稳定性一般。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

92较高

技术栈前沿(CUDA、CUTLASS、FlashAttention),岗位深入底层性能优化,学习曲线陡峭,发展空间大。

技术前沿前沿/新兴技术
技术栈CUDA、CUTLASS、Triton、MLIR、FlashAttention、NPU、PyTorch、vLLM
业务类型ambiguous

工作生活

45较低

为现场办公,工作地点上海,未提及弹性工作或WLB,高性能优化通常工作强度大,生活平衡挑战较大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

AI底层算子支撑大模型发展,行业处于高速增长期,尽管岗位偏技术底层,但对推动AI落地具有重要价值。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs