AMD logo
超威半导体
AI Software Engineer — High-Performance GPU Communication

AI Software Engineer — High-Performance GPU Communication

发布于 大约 2 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Cuda
Hip
Llvm
Pytorch
Rocm
Vllm

AI 估算 · 35k–55k

GPU优化是AI核心方向,技能稀缺,硕士+5年经验要求,上海AI市场竞争力强,AMD薪资具有竞争力。

职位详情

关于这个职位

作为AI软件工程师,您将专注于AMD GPU上的深度学习框架性能优化,包括分布式推理(如P/D分离)和强化学习解决方案

您将深入GPU内核开发,优化vLLM、SGlang等主流框架,并与开源社区协作推动技术落地
该职位要求扎实的C++和GPU编程功底,非常适合对高性能计算和AI基础设施充满热情的技术专家

最低要求

学术资质:计算机科学、计算机工程、电气工程或相关领域的硕士或博士学位

经验要求:5年以上技术软件开发专业经验,专注于GPU优化、性能工程和框架开发
技能要求:在Linux环境中具备扎实的C++开发能力
个人能力:能够在团队协作和独立工作环境中表现出色,具备定义目标、管理开发工作并交付高质量解决方案的能力
其他要求:具备出色的问题解决能力、积极主动的态度,以及对软件工程最佳实践的深刻理解

工作职责

端到端优化:在主流框架(如vLLM和SGlang)上构建并优化端到端分布式推理(例如P/D分离和Large-EP)及RL解决方案

与GPU库团队合作:与内部团队紧密协作,分析和提升AMD GPU上的训练和推理性能
与开源维护者合作:与框架维护者对接,确保代码变更符合要求并集成到上游
在分布式计算环境中工作:在scale-up(多GPU)和scale-out(多节点)系统上优化深度学习性能
利用前沿编译器技术:采用先进的编译器技术提升深度学习性能
优化深度学习流水线:增强完整流水线,包括集成图编译器
软件工程最佳实践:应用扎实的工程原则,确保解决方案健壮且可维护

优先资格

GPU内核开发与优化:

在AMD GPU上使用HIP、CUDA和汇编(ASM)设计并优化深度学习GPU内核方面拥有丰富经验
深入了解AMD架构(GCN、RDNA)和底层编程,以最大化AI运算性能
利用Compute Kernel (CK)、CUTLASS和Triton等工具实现多GPU和多平台性能
深度学习集成:
拥有将优化GPU性能集成到机器学习/LLM框架(如vLLM、SGlang、TensorFlow、PyTorch)的丰富经验,以加速模型训练和推理,关注扩展性和吞吐量
端到端解决方案优化:
了解LLM和多模态的最新市场趋势,具备分布式推理(如P/D分离和Large-EP)和RL的扎实动手E2E性能调优经验
具有文本到视频或图像到视频经验者优先
软件工程:
熟练使用Python和C++,具备调试、性能调优和测试设计经验
高性能计算:
具有在异构计算集群上运行大规模工作负载的专家经验,优化效率和可扩展性
编译器优化:
扎实理解编译器理论和工具(如LLVM和ROCm),用于内核和系统性能优化

AI 洞察

优缺点分析

优点

  • 前沿技术:接触AI芯片、GPU优化等热门领域,技术深度和广度兼具
  • 大厂平台:AMD是半导体巨头,资源丰富,技术积累深厚,职业稳定性高
  • 行业影响力:与开源社区合作,有机会成为关键项目的贡献者
  • 职业前景:高性能计算人才稀缺,长期发展空间大
  • 技术难度高:需要深厚的C++和底层系统知识,学习曲线陡峭
  • 适合对底层性能优化有强烈兴趣、具备扎实C++/GPU功底、喜欢攻克技术难题的工程师

缺点 / 挑战

  • 工作强度:大厂节奏快,可能面临较高的工作压力和紧迫的交付时间
  • 竞争压力:AI领域人才济济,需要持续学习和提升

角色解读

  • 技术专家路线:成为GPU性能优化领域的顶尖专家,主导核心优化项目
  • 架构师路线:向AI基础设施架构师发展,设计大规模计算平台
  • 管理路线:未来可带领团队,负责GPU计算平台的整体规划和落地
  • 优化AMD GPU上的深度学习框架性能,提升训练和推理效率
  • 开发并优化GPU内核(kernel),使用HIP、CUDA等底层语言实现高性能计算
  • 与内部GPU库团队和开源社区协作,集成优化方案并推动上游合并
  • 参与分布式系统下的性能调优,支持大规模AI模型训练和部署
  • 精通C++和Python,熟悉Linux开发环境
  • 深入理解GPU架构和并行计算,掌握HIP/CUDA编程
  • 熟悉深度学习框架(如PyTorch、vLLM)和编译技术(如LLVM、ROCm)
  • 具备分布式计算和高性能集群的实际操作经验

申请策略

  • 了解AMD GPU产品线(如MI系列),在面试中展现行业洞察
  • 关注AI基础设施趋势,如P/D分离、Large-EP等新技术
  • 突出GPU内核优化项目,量化性能提升(如吞吐量提升50%)
  • 强调对CUDA/HIP的深入理解,展示具体实现细节
  • 展现分布式系统或深度学习框架的调优案例,如vLLM或SGlang
  • 提及开源贡献(如PR被合并),体现协作能力
  • 学习AMD ROCm平台和HIP编程模型,掌握其与CUDA的异同
  • 研读vLLM、SGlang等框架源码,理解其性能优化点

面试指南

  • 优化案例:按照问题背景→性能分析→瓶颈定位→优化措施→效果验证的框架回答,突出量化结果
  • 经验描述:使用STAR法则(情境、任务、行动、结果),重点说明个人贡献
  • 开放性技术问题:先阐述思路,再分步骤说明,体现逻辑性和深度
  • 请描述一个你优化GPU kernel的案例,具体你做了什么?
  • 如何定位分布式训练中的性能瓶颈?
  • 你如何看待AMD ROCm与CUDA的竞争?
  • 如果让你在vLLM中集成一个自定义kernel,你会怎么做?
  • 在Linux环境下,如何调试一个性能问题?

职位点评

74
综合评分

AI芯片巨头,前沿GPU优化技术栈,高薪但工作生活平衡未知,职业发展潜力巨大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术成长、渴望接触前沿AI基础设施、对GPU优化有热情的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活50
使命价值85

薪资福利

70中等

AMD作为上市巨头,薪资水平有竞争力,但JD未透露具体数字,福利信息有限,稳定性较好。

薪资信号未披露(AI估算:35K-55K/月)

成长发展

90较高

职位涉及GPU性能优化、分布式推理等前沿技术,技能成长空间巨大,且与开源社区合作可提升行业影响力。

技术前沿前沿/新兴技术
技术栈CUDA、HIP、C++、Python、vLLM、PyTorch、ROCm、LLVM、Triton
成长机会advance your career
业务类型ambiguous

工作生活

50较低

要求现场办公,未提及弹性或远程,WLB信号不明显,可能面临较大工作强度。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

AMD致力于加速下一代计算体验,AI芯片行业前景广阔,工作具有明显的技术社会价值。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号build great products that accelerate next-generation computing experiences
创新程度积极采用新技术
Watch Jobs