AMD logo
超威半导体
AI kernel Development Engineer

AI kernel Development Engineer

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
专家级经验
全职员工
仅现场办公
本科
机器学习工程
Ai Kernel
Cuda
Gpu
Tensorrt-Llm
性能优化
Amd Rocm

AI 估算 · 45k–75k

AI内核开发技术前沿,人才稀缺,上海薪酬高;AMD国际大厂薪资有竞争力。

职位详情

关于这个职位

作为AMD的AI内核开发工程师,你将专注于优化关键应用和基准测试的性能,开发基于AMD GPU的高效内核

你将与全球顶尖专家合作,使用最新的AI推理库和Triton编译器,为关键客户提供技术支持,并参与未来架构的设计

最低要求

计算机科学、计算机工程、电气工程或同等学历的本科或硕士学位

工作职责

开发并推动复杂新技术和新产品导入项目的全面、高效软件

为关键客户项目提供快速、稳健的技术支持
开发优化特性并在发布给客户前进行验证
为高功能特性团队做出贡献
与多个团队紧密合作,交付关键规划解决方案及其支持技术
帮助设计并实现未来架构,构建高度可扩展、持久且创新的系统
与开发团队和项目经理密切合作,推动结果达成
熟练使用AI代理工具辅助测试和分析工作,提升日常工作效率

优先资格

精通C、C++、Python,并有丰富的实践经验

熟悉AI运算库(如flashInfer、tensorRT-LLM、CUTLASS、Aiter(AMD)等),能使用并定制库中的算子和算子融合
熟悉Triton编译器后端,能在llir/ASM层进行显式布局和流水线优化,有实现CUDA/Triton/Gluon内核的经验,计算密集型内核能实现至少50%的MFU
对roofline性能分析方法有深入理解,能熟练使用NVIDIA Nsight、ROCprofiler等性能分析工具
熟悉AMD CNDA/RDNA SIMD/架构,有AMD平台内核开发经验者优先

AI 洞察

优缺点分析

优点

  • 接触最前沿的AI加速硬件和软件技术,技术成长空间大
  • 与全球顶尖工程师协作,平台和团队资源丰富
  • AMD在AI和数据中心领域快速崛起,职业前景广阔
  • 要求极高的技术深度,需同时掌握底层架构和算法实现
  • 工作强度可能较大,需要快速响应客户问题并push到解决
  • 对内核性能有极高要求(如MFU≥50%),调试和优化难度大
  • 适合对底层系统、GPU架构和性能优化有强烈热情,且能适应高强度研发工作的技术人才

缺点 / 挑战

暂无明显挑战项

角色解读

  • 在AI芯片领域积累深厚的底层优化经验,成为GPU计算专家
  • 可向技术专家(Staff/Senior)或架构师方向发展,主导核心模块设计
  • 有机会接触AMD全球领先的AI和GPU技术,未来可转向深度学习框架或AI基础设施等方向
  • 开发并优化针对AMD GPU平台的AI内核,实现高性能计算
  • 为关键客户项目提供快速、稳健的技术支持,解决复杂性能问题
  • 与多个团队协作,设计和实现未来可扩展的高性能系统架构
  • 使用AI辅助工具进行测试和性能分析,提升开发效率
  • 精通C/C++和Python,具备扎实的编程功底
  • 熟悉AI推理库(如flashInfer、tensorRT-LLM、CUTLASS)并能够定制算子
  • 掌握Triton/CUDA内核开发,理解GPU架构和性能优化方法
  • 熟悉性能分析工具(如NVIDIA Nsight、ROCprofiler)和roofline模型

申请策略

  • 了解AMD在AI领域的最新产品和布局,展现对公司的热情
  • 准备一个实际的内核优化案例,展示你分析和解决问题的能力
  • 突出C/C++/Python的项目经验,尤其是高性能计算或GPU相关项目
  • 展示你在CUDA/Triton内核开发方面的实践,附上性能提升数据
  • 如有使用AMD ROCm或CUTLASS等库的经验,务必突出
  • 强调对AI推理框架(如TensorRT-LLM)的理解和贡献
  • 深入了解Triton编译器后端和GPU SIMT架构,练习手写内核
  • 学习使用Nsight或ROCprofiler进行性能瓶颈分析和优化

面试指南

  • 在回答技术问题时可结合项目案例,遵循'情景-任务-行动-结果'的结构,突出量化成果和深入思考
  • 对于优化问题,可以从剖析性能瓶颈、内存访问模式、计算密度等角度展开,展示系统性的分析方法
  • 对于架构对比,可指出AMD CDNA与NVIDIA Ampere/Hopper在SIMD宽度、共享内存等方面的异同
  • 请描述你曾经优化过一个CUDA/Triton内核的过程,遇到了哪些性能瓶颈?
  • 如何确保内核达到50%以上的MFU?
  • 你对roofline模型和FLOPs的计算有何理解?
  • 请解释一下算子融合的原理和优缺点
  • 在AMD和NVIDIA GPU架构上编写内核有什么不同?

职位点评

74
综合评分

国际芯片巨头,前沿AI内核开发岗,技术含量高、薪资优厚,但工作地点固定、WLB信息不足。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合以技术成长和行业前沿为核心追求,对薪资有较高期待并能适应现场办公的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活55
使命价值78

薪资福利

75中等

该职位薪资水平预计较高,AMD作为国际大厂提供有竞争力的薪酬和福利,但JD未明确具体薪资信息。

薪资信号未披露(AI估算:45K-75K/月)

成长发展

85较高

职位处于AI加速前沿,技术挑战大,能快速积累GPU内核开发和异构计算经验,发展空间广阔。

技术前沿前沿/新兴技术
技术栈C++、CUDA、Triton、TensorRT-LLM、CUTLASS、AMD ROCm
业务类型ambiguous

工作生活

55较低

仅现场办公,未提及弹性工作或远程政策,无法判断工作生活平衡情况,存在加班可能性但不确定。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

78中等

AMD的使命是推动下一代计算,AI和GPU对行业有重要影响,工作具有较高价值感和使命感。

行业发展高速增长赛道
社会影响中性/一般
使命信号build great products that accelerate next-generation computing experiences、solve the world’s most important challenges、shape the future of AI
创新程度积极采用新技术
Watch Jobs