AMD logo
超威半导体
AI Software Development Eng.

AI Software Development Eng.

发布于 大约 14 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Gpu优化
Hip
Llvm
Mlir
Pytorch
Rocm
Sglang
Tensorflow

AI 估算 · 35k–65k

资深GPU软件工程师稀缺,AI赛道火热,AMD技术平台强,北京薪资水平高,预估月薪3.5-6.5万。

职位详情

关于这个职位

该职位负责优化AMD GPU上的深度学习框架(如TensorFlow、PyTorch、SGLang),开发高性能GPU内核,并进行分布式系统优化

你将与编译器团队和开源社区协作,推动AI软件生态发展
适合对高性能计算和AI基础设施有热情的技术专家

最低要求

个人要求:

熟练的工程师,具备在Linux环境下进行C++开发的技术和分析能力
能在协作团队和独立工作环境中都能胜任,能够定义目标、管理开发工作并交付高质量解决方案
强大的问题解决能力、积极主动的方法,并深刻理解软件工程最佳实践
学历要求:
计算机科学、计算机工程、电子工程或相关领域的学士和/或硕士学位

工作职责

优化深度学习框架:通过开源仓库的上游贡献,提升TensorFlow、PyTorch和SGLang等框架在AMD GPU上的性能

开发和优化深度学习模型:对大规模训练和推理模型进行性能剖析和调优,以达到AMD硬件上的最佳性能
GPU内核开发:使用HIP、Triton或其他相关工具设计、实现和优化高性能GPU内核,以提升AI算子效率
与GPU库和编译器团队协作:与内部编译器和GPU数学库团队紧密合作,整合和调整内核级优化以符合全栈性能目标
贡献SGLang开发:支持SGLang LLM框架在AMD GPU平台上的优化、功能开发和扩展
分布式系统优化:在多GPU(scale-up)和多节点(scale-out)环境中调优和扩展性能,包括推理并行和集合通信策略
图编译器集成:通过图编译器(如XLA、TorchDynamo或自定义流水线)集成和优化运行时执行
开源合作:与外部维护者合作,理解框架需求,提出优化建议并有效地进行上游贡献
应用工程最佳实践:在调试、剖析、测试驱动开发和CI集成中应用现代软件工程实践

优先资格

优先经验:

强大的编程技能:精通C++和/或Python,具备调试、剖析和优化性能关键代码的能力
SGLang和LLM优化:具有SGLang或类似LLM推理框架的扎实实践经验者优先
编译器和GPU架构知识:具有编译器设计背景或熟悉LLVM、MLIR或ROCm等技术者优先
异构系统工作负载:具有在大规模异构集群(CPU+GPU)上使用分布式训练或推理策略运行和扩展工作负载的专业经验
AI框架集成:具有深度学习框架(如PyTorch或TensorFlow)的集成优化经验或贡献
GPU计算:熟悉HIP、CUDA或其他GPU编程模型
具有GCN/CDNA架构经验者优先

AI 洞察

优缺点分析

优点

  • AMD GPU生态迅速崛起,公司平台强大,与知名开源社区协作
  • 高薪高福利,外资企业工作文化相对开放
  • 能接触从内核到系统的全栈技术,技能积累深厚
  • 技术难度大,需要同时掌握框架、编译器和硬件知识
  • 相比互联网大厂,国内AMD团队规模较小,内部晋升路径可能有限
  • 适合对高性能计算充满热情,擅长底层优化,愿意在技术领域深耕的工程师

缺点 / 挑战

  • 处于AI基础设施前沿,技术挑战大,成长空间广阔
  • 开源社区协作需要沟通和长期投入,工作压力可能较大

角色解读

  • 从GPU内核优化专家向AI系统架构师发展,负责更大规模的训练推理系统设计
  • 深入编译器底层,成为编译器与硬件协同设计专家
  • 在开源社区建立影响力,成长为技术领袖,参与行业标准制定
  • 优化深度学习框架(如TensorFlow、PyTorch、SGLang)在AMD GPU上的性能,通过上游贡献开源代码
  • 开发和优化大规模训练与推理模型,进行性能剖析和调优
  • 使用HIP、Triton等工具设计实现高性能GPU内核,提升AI算子效率
  • 与编译器和GPU数学库团队协作,集成图编译器(如XLA、TorchDynamo)并优化分布式系统
  • 精通C++和Python,能在Linux环境下进行性能关键代码的调试、剖析和优化
  • 熟悉GPU编程模型(HIP、CUDA)和深度学习框架内部机制
  • 了解编译器技术(LLVM、MLIR)或GPU架构(GCN/CDNA)者优先
  • 具备分布式训练和推理的调优经验,熟悉SGLang等LLM推理框架

申请策略

  • 调研AMD ROCm软件栈,了解其与CUDA生态的差异
  • 准备深入的技术面试,可能包含现场编程和系统设计
  • 突出GPU相关项目经验,如CUDA/HIP内核优化、性能调优案例
  • 展示对PyTorch/TensorFlow内部机制的理解和实际贡献
  • 强调分布式训练或推理系统经验,附上具体性能提升数据
  • 如有开源贡献,列出PR或issue链接
  • 系统学习HIP/CUDA编程模型,动手实现算子内核
  • 了解LLVM/MLIR基础,熟悉图编译器工作流程

面试指南

  • 对于性能优化问题,采用“剖析-定位-优化-验证”的框架,给出量化指标
  • 对于设计问题,从需求分析、硬件特性、算法选择、实现细节逐步展开
  • 对于开源协作问题,强调沟通、测试和文档的重要性
  • 如何优化一个PyTorch算子性能?请给出具体步骤
  • 解释HIP与CUDA的异同,以及如何转换
  • 描述你在分布式训练中遇到的通信瓶颈及解决方案
  • 如何为深度学习框架设计一个高效的GPU内核?
  • 谈谈你对MLIR或XLA的理解

职位点评

73
综合评分

前沿GPU软件优化专家岗位,技术成长空间大,薪资未明但平台好,现场办公需接受一定强度。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和职业成长,对工作生活平衡要求不高的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活55
使命价值75

薪资福利

70中等

薪资水平未披露但预计具有竞争力,AMD作为上市大公司福利完善,但北京生活成本高,相对互联网大厂可能略保守。

薪资信号未披露(AI估算:35K-65K/月)

成长发展

90较高

技术栈前沿(GPU、编译器、AI框架),学习资源丰富,与开源社区深度协作,职业发展空间大。

技术前沿前沿/新兴技术
技术栈C++、Python、TensorFlow、PyTorch、SGLang、HIP、CUDA、ROCm、LLVM、MLIR、XLA、TorchDynamo
业务类型ambiguous

工作生活

55较低

仅现场办公,无弹性或远程信号,工作强度未知,但技术岗可能面临项目压力。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

AMD的使命是加速下一代计算体验,推动AI发展,工作具有技术上的使命感,但社会影响间接。

行业发展高速增长赛道
社会影响中性/一般
使命信号build great products that accelerate next-generation computing experiences、solve the world’s most important challenges、shape the future of AI
创新程度积极采用新技术
Watch Jobs