AgiBot logo
智元机器人
优才-算子开发工程师(训推底层算子 / 高性能计算方向)

优才-算子开发工程师(训推底层算子 / 高性能计算方向)

发布于 大约 15 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Cuda
Flashattention
Gpu优化
Mlir
Pytorch
Vllm
昇腾
高性能计算

AI 估算 · 35k–60k

AI算子开发属高端稀缺技能,上海薪资竞争激烈,硕士2年经验通常35K-60K/月。

职位详情

关于这个职位

该职位负责AI训练和推理底层算子的开发与极致优化,包括Transformer核心算子、高性能矩阵乘等

你将基于CUDA/Triton/MLIR编写高性能算子,并在GPU/NPU上做性能调优,直接支撑大模型训练和推理效率
需要扎实的C++/CUDA功底和并行计算经验

最低要求

硕士及以上,计算机/电子/数学相关,2年+AI算子/HPC开发经验

精通C++/CUDA编程,熟悉GPU/NPU体系结构、共享内存、流水线、访存优化
理解深度学习核心算子:GEMM、Conv、LayerNorm、Softmax、Attention、Quant
熟悉性能分析工具:Nsight Compute/Systems、perf、VTune

工作职责

负责Transformer/Attention/FFN、矩阵乘、融合算子、量化算子的开发与极致优化

基于CUDA/CUTLASS/Triton/MLIR开发高性能算子,支撑训练与推理性能提升
针对 GPU/NPU/昇腾/寒武纪等硬件做算子适配、性能调优、软硬件协同
实现FlashAttention-2/3、FlashInfer、DeepGEMM、PagedAttention、FP8/FP4等核心算子
负责算子性能分析、瓶颈定位、显存/计算/访存优化,达到硬件算力上限
与训练/推理团队协同,将定制算子集成到PyTorch/Transformers/vllm等训练和推理框架中
构建算子测试、benchmark、自动化验证体系,保证稳定性与兼容性

优先资格

熟悉Triton/CUTLASS/cuBLAS/cuDNN,有算子库开发经验优先

有PyTorch算子开发、自定义算子、推理引擎算子接入经验优先
具备扎实的数值计算、并行算法、汇编/IR阅读能力优先

AI 洞察

优缺点分析

优点

  • 技术含金量高,掌握AI底层核心技术,稀缺性强,市场价值大
  • 接触最新GPU/NPU硬件和前沿算法,紧跟AI基础设施发展浪潮
  • 公司在机器人赛道,B轮阶段,平台成长性好,有期权潜力
  • 门槛高,需要扎实的C++/CUDA功底,学习曲线陡峭
  • 硬件迭代快,需要不断学习新技术和适配不同平台

缺点 / 挑战

  • 工作强度可能较大,性能优化任务挑战性强,需要持续攻坚
  • 适合对底层系统和性能优化有浓厚兴趣,具备扎实编程能力,喜欢挑战技术难点的工程师

角色解读

  • 可从算子开发工程师向资深高性能计算专家或AI框架工程师发展
  • 有机会深入硬件底层,成为软硬件协同设计专家,或转型AI芯片架构师
  • 由于AI基础设施需求旺盛,可向技术专家或技术管理方向晋升
  • 开发和优化Transformer/Attention等深度学习核心算子,包括矩阵乘、融合算子、量化算子
  • 基于CUDA/Triton/MLIR编写高性能算子,针对GPU/NPU等硬件进行适配与调优
  • 实现FlashAttention、PagedAttention等先进算法,集成到PyTorch、vLLM等框架中
  • 搭建算子测试和benchmark体系,分析性能瓶颈并优化到硬件算力上限
  • 精通C++/CUDA编程,理解GPU/NPU体系结构和访存优化
  • 熟悉Triton/CUTLASS等算子开发工具,以及Nsight等性能分析工具
  • 深入理解深度学习核心算子的实现原理和数值计算

申请策略

  • 了解智元机器人的业务方向,结合机器人对AI算力的需求阐述兴趣
  • 可以准备一个算子优化的案例,展示你的分析和解决能力
  • 突出高性能计算项目经历,如GPU算子开发、性能调优案例,附上量化数据(如提速X%)
  • 强调CUDA/Triton/CUTLASS等工具的实际使用经验,以及熟悉的硬件平台
  • 展示对深度学习算子的理解,如GEMM、Attention等原理或实现
  • 系统学习CUDA编程和GPU体系结构,动手实现简单算子
  • 熟悉Triton或CUTLASS框架,并阅读FlashAttention等核心源码
  • 掌握性能分析工具(Nsight、perf)的使用

面试指南

  • 对于项目类问题,用STAR法则:背景、任务、行动、结果,突出量化成果
  • 对于原理类问题,从基本概念出发,结合计算和访存分析,展示深度理解
  • 对于开放性问题,先拆解问题,分点回答,再举具体例子佐证
  • 介绍一下你做过的算子优化项目,如何定位瓶颈并优化?
  • CUDA中shared memory和global memory的访问优化有哪些方法?
  • 请解释FlashAttention的原理和它为什么比标准Attention快
  • 如何将自定义算子集成到PyTorch中?
  • 谈谈你对Triton和CUTLASS的理解,它们各自优缺点?

职位点评

68
综合评分

AI算子开发岗,前沿技术栈,薪资市场水准,工作节奏未明确,成长性强。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和职业发展空间,对薪资和WLB要求尚可的底层技术工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展88
工作生活50
使命价值70

薪资福利

60中等

JD未披露薪资,但AI算子岗位市场薪酬较高,B轮公司提供期权可能,但稳定性一般。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

88较高

该岗位涉及CUDA、Triton等前沿技术,处于AI基础设施核心,技能成长快。JD中无明确培训晋升信息。

技术前沿前沿/新兴技术
技术栈CUDA、Triton、CUTLASS、MLIR、FlashAttention、vLLM、GPU、NPU
业务类型ambiguous

工作生活

50较低

工作地点在上海,要求现场办公,未提及弹性时间,可能有较强项目压力。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

智元机器人处于具身智能赛道,行业前景广阔,但岗位偏底层技术,直接社会影响较间接。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs