
超威半导体
AI kernel Development Engineer
AI kernel Development Engineer
发布于 大约 14 小时前普通员工/个人贡献者
上海市
专家级经验
全职员工
仅现场办公
本科
机器学习工程
Ai Kernel
Cuda
Gpu
Tensorrt-Llm
性能优化
Amd Rocm
AI 估算 · 45k–75k
AI内核开发技术前沿,人才稀缺,上海薪酬高;AMD国际大厂薪资有竞争力。
职位详情
关于这个职位
作为AMD的AI内核开发工程师,你将专注于优化关键应用和基准测试的性能,开发基于AMD GPU的高效内核
你将与全球顶尖专家合作,使用最新的AI推理库和Triton编译器,为关键客户提供技术支持,并参与未来架构的设计
最低要求
计算机科学、计算机工程、电气工程或同等学历的本科或硕士学位
工作职责
开发并推动复杂新技术和新产品导入项目的全面、高效软件
为关键客户项目提供快速、稳健的技术支持
开发优化特性并在发布给客户前进行验证
为高功能特性团队做出贡献
与多个团队紧密合作,交付关键规划解决方案及其支持技术
帮助设计并实现未来架构,构建高度可扩展、持久且创新的系统
与开发团队和项目经理密切合作,推动结果达成
熟练使用AI代理工具辅助测试和分析工作,提升日常工作效率
优先资格
精通C、C++、Python,并有丰富的实践经验
熟悉AI运算库(如flashInfer、tensorRT-LLM、CUTLASS、Aiter(AMD)等),能使用并定制库中的算子和算子融合
熟悉Triton编译器后端,能在llir/ASM层进行显式布局和流水线优化,有实现CUDA/Triton/Gluon内核的经验,计算密集型内核能实现至少50%的MFU
对roofline性能分析方法有深入理解,能熟练使用NVIDIA Nsight、ROCprofiler等性能分析工具
熟悉AMD CNDA/RDNA SIMD/架构,有AMD平台内核开发经验者优先
AI 洞察
优缺点分析
优点
- 接触最前沿的AI加速硬件和软件技术,技术成长空间大
- 与全球顶尖工程师协作,平台和团队资源丰富
- AMD在AI和数据中心领域快速崛起,职业前景广阔
- 要求极高的技术深度,需同时掌握底层架构和算法实现
- 工作强度可能较大,需要快速响应客户问题并push到解决
- 对内核性能有极高要求(如MFU≥50%),调试和优化难度大
- 适合对底层系统、GPU架构和性能优化有强烈热情,且能适应高强度研发工作的技术人才
缺点 / 挑战
暂无明显挑战项
角色解读
- 在AI芯片领域积累深厚的底层优化经验,成为GPU计算专家
- 可向技术专家(Staff/Senior)或架构师方向发展,主导核心模块设计
- 有机会接触AMD全球领先的AI和GPU技术,未来可转向深度学习框架或AI基础设施等方向
- 开发并优化针对AMD GPU平台的AI内核,实现高性能计算
- 为关键客户项目提供快速、稳健的技术支持,解决复杂性能问题
- 与多个团队协作,设计和实现未来可扩展的高性能系统架构
- 使用AI辅助工具进行测试和性能分析,提升开发效率
- 精通C/C++和Python,具备扎实的编程功底
- 熟悉AI推理库(如flashInfer、tensorRT-LLM、CUTLASS)并能够定制算子
- 掌握Triton/CUDA内核开发,理解GPU架构和性能优化方法
- 熟悉性能分析工具(如NVIDIA Nsight、ROCprofiler)和roofline模型
申请策略
- 了解AMD在AI领域的最新产品和布局,展现对公司的热情
- 准备一个实际的内核优化案例,展示你分析和解决问题的能力
- 突出C/C++/Python的项目经验,尤其是高性能计算或GPU相关项目
- 展示你在CUDA/Triton内核开发方面的实践,附上性能提升数据
- 如有使用AMD ROCm或CUTLASS等库的经验,务必突出
- 强调对AI推理框架(如TensorRT-LLM)的理解和贡献
- 深入了解Triton编译器后端和GPU SIMT架构,练习手写内核
- 学习使用Nsight或ROCprofiler进行性能瓶颈分析和优化
面试指南
- 在回答技术问题时可结合项目案例,遵循'情景-任务-行动-结果'的结构,突出量化成果和深入思考
- 对于优化问题,可以从剖析性能瓶颈、内存访问模式、计算密度等角度展开,展示系统性的分析方法
- 对于架构对比,可指出AMD CDNA与NVIDIA Ampere/Hopper在SIMD宽度、共享内存等方面的异同
- 请描述你曾经优化过一个CUDA/Triton内核的过程,遇到了哪些性能瓶颈?
- 如何确保内核达到50%以上的MFU?
- 你对roofline模型和FLOPs的计算有何理解?
- 请解释一下算子融合的原理和优缺点
- 在AMD和NVIDIA GPU架构上编写内核有什么不同?
职位点评
74
综合评分
国际芯片巨头,前沿AI内核开发岗,技术含量高、薪资优厚,但工作地点固定、WLB信息不足。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合以技术成长和行业前沿为核心追求,对薪资有较高期待并能适应现场办公的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活55
使命价值78
薪资福利
75中等
该职位薪资水平预计较高,AMD作为国际大厂提供有竞争力的薪酬和福利,但JD未明确具体薪资信息。
薪资信号未披露(AI估算:45K-75K/月)
成长发展
85较高
职位处于AI加速前沿,技术挑战大,能快速积累GPU内核开发和异构计算经验,发展空间广阔。
技术前沿前沿/新兴技术
技术栈C++、CUDA、Triton、TensorRT-LLM、CUTLASS、AMD ROCm
业务类型ambiguous
工作生活
55较低
仅现场办公,未提及弹性工作或远程政策,无法判断工作生活平衡情况,存在加班可能性但不确定。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
78中等
AMD的使命是推动下一代计算,AI和GPU对行业有重要影响,工作具有较高价值感和使命感。
行业发展高速增长赛道
社会影响中性/一般
使命信号build great products that accelerate next-generation computing experiences、solve the world’s most important challenges、shape the future of AI
创新程度积极采用新技术
超威半导体 的其他在招职位
相似职位推荐
Watch Jobs