
超威半导体
AI Optimization Engineer
AI Optimization Engineer
发布于 大约 14 小时前普通员工/个人贡献者
上海市
专家级经验
全职员工
仅现场办公
本科
机器学习工程
Ai推理
Cuda
Rocprofiler
Tensorrt-Llm
内核优化
性能优化
AI 估算 · 30k–60k
AI优化岗位技术门槛高,AMD上海研发中心薪资有竞争力,结合市场行情估算。
职位详情
关于这个职位
该职位负责优化AMD平台上关键应用和基准测试的性能,专注于AI推理内核与运算库的深度优化
你将与全球顶尖工程师协作,接触最新的硬件和软件栈,适合对底层性能调优充满热情的C++/Python高手
最低要求
理想的候选人应对软件工程充满热情,并具备领导技能以推动复杂问题解决
能够与AMD的不同团队有效沟通和协作
计算机科学、计算机工程、电气工程或同等学历的学士或硕士学位
工作职责
开发和推动执行全面高效的软件,用于复杂的新技术和新产品引入项目
为关键客户项目提供快速而强大的技术支持
开发优化功能并在发布给客户前验证
为高功能特性团队做出贡献
与多个团队紧密合作,交付关键规划解决方案和支持技术
帮助设计未来架构,实现高度可扩展、耐用、创新的系统
与开发团队和项目经理紧密合作推动结果
熟练使用AI代理工具辅助测试和分析工作,提高日常工作效率
优先资格
在C、C++、Python方面拥有专家级知识和实践经验
熟悉AI运算库,如flashInfer、tensorRT-LLM、CUTLASS、Aiter(AMD)等
使用并自定义上述库中的ops和ops融合
熟悉Triton编译器后端,在llir/ASM上使用显式布局和流水线优化
有CUDA/Triton/Gluon内核实现经验,能够达到至少50% MFU的计算密集内核
对roofline性能分析能力有扎实理解,使用profiling工具(如Nsight、ROCprofiler等)进行优化分析
熟悉AMD CNDA/RDNA SIMD/架构,有基于AMD平台的内核开发经验者优先
AI 洞察
优缺点分析
优点
- 能接触到最新的AI硬件和软件栈,技术前沿性高
- AMD为国际大厂,平台资源丰富,可与全球顶尖工程师合作
- 性能优化领域人才稀缺,职业竞争力强
- 底层内核优化要求极高的技术深度,学习曲线陡峭
- 对多硬件架构(AMD/GPU)的熟悉程度要求高,知识面需广
缺点 / 挑战
- 可能需要面对复杂的问题和快节奏的项目交付,工作压力较大
- 适合对底层性能调优有浓厚兴趣、精通C++和GPU编程、喜欢挑战高难度技术问题的工程师
角色解读
- 可成长为技术专家,深入研究AI芯片性能优化领域
- 有机会转向架构设计或技术管理方向,领导优化团队
- 在AMD可接触前沿AI硬件,向全栈或AI基础设施方向发展
- 负责优化AMD平台上AI应用和基准测试的性能,通过内核优化、算子融合等手段提升计算效率
- 开发并验证高性能软件功能,为关键客户提供技术支持
- 与多个团队协作,设计可扩展的系统架构,并利用AI工具提升测试和分析效率
- 精通C/C++和Python,具备扎实的底层编程能力
- 熟悉AI运算库(如TensorRT-LLM、CUTLASS)和GPU编程(CUDA/Triton),能进行内核开发和优化
- 掌握性能分析工具(如Nsight、ROCprofiler)和roofline模型分析方法
申请策略
- 关注AMD的AI战略和产品线,在面试中展示对硬件优化的理解
- 准备一个完整的性能优化案例,展示分析、实现和验证的整个过程
- 突出C/C++编程经验和项目中的性能优化成果,如提升的MFU或延迟指标
- 展示对AI运算库(如TensorRT-LLM、CUTLASS)的内核开发或算子融合经验
- 若有GPU编程(CUDA/Triton)经验,务必强调
- 如有开源项目贡献或性能调优博客,可增加亮点
- 提前学习ROCm或CUDA编程,掌握Triton编译器后端
- 熟悉roofline模型和性能分析工具(Nsight、ROCprofiler)
面试指南
- 对于性能优化问题,采用'分析-定位-优化-验证'的框架,先使用profiler定位瓶颈,再根据roofline模型决定优化方向,最后用数据验证
- 对于技术经验问题,用STAR法则,突出具体对比效果
- 对于AMD平台问题,强调自己的学习能力和迁移能力
- 请描述一次你如何优化某个计算内核的性能,使用了哪些方法和工具?
- 你对roofline模型的理解是什么?如何利用它指导优化?
- 你熟悉哪些AI运算库?能否举例说明如何实现算子融合?
- 如何调试一个性能低下的GPU内核?
- 你有使用Triton的经验吗?它的优势是什么?
职位点评
75
综合评分
AI优化核心技术岗,技术前沿,薪资有竞争力但未披露,WLB未知。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术成长和前沿发展的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活60
使命价值80
薪资福利
75中等
该职位未披露具体薪资,但AMD作为全球半导体巨头,薪酬福利体系成熟,整体具有竞争力。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
85较高
岗位技术前沿性强,能深入AI底层优化,技能积累价值高,公司鼓励职业发展。
技术前沿前沿/新兴技术
技术栈C++、Python、TensorRT-LLM、CUTLASS、Triton、CUDA、ROCprofiler、AI优化
成长机会advance your career
业务类型ambiguous
工作生活
60中等
工作地点在上海,但具体办公模式未明确,AMD外企通常WLB较好,但JD中未提及,无法确证。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
AMD致力于加速下一代计算体验,岗位直接参与AI基础设施优化,具有行业影响力。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号accelerate next-generation computing experiences、shape the future of AI
创新程度积极采用新技术
超威半导体 的其他在招职位
相似职位推荐
Watch Jobs