
超威半导体
AI Software Engineer — High-Performance GPU Communication
AI Software Engineer — High-Performance GPU Communication
发布于 大约 2 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Cuda
Hip
Llvm
Pytorch
Rocm
Vllm
AI 估算 · 35k–55k
GPU优化是AI核心方向,技能稀缺,硕士+5年经验要求,上海AI市场竞争力强,AMD薪资具有竞争力。
职位详情
关于这个职位
作为AI软件工程师,您将专注于AMD GPU上的深度学习框架性能优化,包括分布式推理(如P/D分离)和强化学习解决方案
您将深入GPU内核开发,优化vLLM、SGlang等主流框架,并与开源社区协作推动技术落地
该职位要求扎实的C++和GPU编程功底,非常适合对高性能计算和AI基础设施充满热情的技术专家
最低要求
学术资质:计算机科学、计算机工程、电气工程或相关领域的硕士或博士学位
经验要求:5年以上技术软件开发专业经验,专注于GPU优化、性能工程和框架开发
技能要求:在Linux环境中具备扎实的C++开发能力
个人能力:能够在团队协作和独立工作环境中表现出色,具备定义目标、管理开发工作并交付高质量解决方案的能力
其他要求:具备出色的问题解决能力、积极主动的态度,以及对软件工程最佳实践的深刻理解
工作职责
端到端优化:在主流框架(如vLLM和SGlang)上构建并优化端到端分布式推理(例如P/D分离和Large-EP)及RL解决方案
与GPU库团队合作:与内部团队紧密协作,分析和提升AMD GPU上的训练和推理性能
与开源维护者合作:与框架维护者对接,确保代码变更符合要求并集成到上游
在分布式计算环境中工作:在scale-up(多GPU)和scale-out(多节点)系统上优化深度学习性能
利用前沿编译器技术:采用先进的编译器技术提升深度学习性能
优化深度学习流水线:增强完整流水线,包括集成图编译器
软件工程最佳实践:应用扎实的工程原则,确保解决方案健壮且可维护
优先资格
GPU内核开发与优化:
在AMD GPU上使用HIP、CUDA和汇编(ASM)设计并优化深度学习GPU内核方面拥有丰富经验
深入了解AMD架构(GCN、RDNA)和底层编程,以最大化AI运算性能
利用Compute Kernel (CK)、CUTLASS和Triton等工具实现多GPU和多平台性能
深度学习集成:
拥有将优化GPU性能集成到机器学习/LLM框架(如vLLM、SGlang、TensorFlow、PyTorch)的丰富经验,以加速模型训练和推理,关注扩展性和吞吐量
端到端解决方案优化:
了解LLM和多模态的最新市场趋势,具备分布式推理(如P/D分离和Large-EP)和RL的扎实动手E2E性能调优经验
具有文本到视频或图像到视频经验者优先
软件工程:
熟练使用Python和C++,具备调试、性能调优和测试设计经验
高性能计算:
具有在异构计算集群上运行大规模工作负载的专家经验,优化效率和可扩展性
编译器优化:
扎实理解编译器理论和工具(如LLVM和ROCm),用于内核和系统性能优化
AI 洞察
优缺点分析
优点
- 前沿技术:接触AI芯片、GPU优化等热门领域,技术深度和广度兼具
- 大厂平台:AMD是半导体巨头,资源丰富,技术积累深厚,职业稳定性高
- 行业影响力:与开源社区合作,有机会成为关键项目的贡献者
- 职业前景:高性能计算人才稀缺,长期发展空间大
- 技术难度高:需要深厚的C++和底层系统知识,学习曲线陡峭
- 适合对底层性能优化有强烈兴趣、具备扎实C++/GPU功底、喜欢攻克技术难题的工程师
缺点 / 挑战
- 工作强度:大厂节奏快,可能面临较高的工作压力和紧迫的交付时间
- 竞争压力:AI领域人才济济,需要持续学习和提升
角色解读
- 技术专家路线:成为GPU性能优化领域的顶尖专家,主导核心优化项目
- 架构师路线:向AI基础设施架构师发展,设计大规模计算平台
- 管理路线:未来可带领团队,负责GPU计算平台的整体规划和落地
- 优化AMD GPU上的深度学习框架性能,提升训练和推理效率
- 开发并优化GPU内核(kernel),使用HIP、CUDA等底层语言实现高性能计算
- 与内部GPU库团队和开源社区协作,集成优化方案并推动上游合并
- 参与分布式系统下的性能调优,支持大规模AI模型训练和部署
- 精通C++和Python,熟悉Linux开发环境
- 深入理解GPU架构和并行计算,掌握HIP/CUDA编程
- 熟悉深度学习框架(如PyTorch、vLLM)和编译技术(如LLVM、ROCm)
- 具备分布式计算和高性能集群的实际操作经验
申请策略
- 了解AMD GPU产品线(如MI系列),在面试中展现行业洞察
- 关注AI基础设施趋势,如P/D分离、Large-EP等新技术
- 突出GPU内核优化项目,量化性能提升(如吞吐量提升50%)
- 强调对CUDA/HIP的深入理解,展示具体实现细节
- 展现分布式系统或深度学习框架的调优案例,如vLLM或SGlang
- 提及开源贡献(如PR被合并),体现协作能力
- 学习AMD ROCm平台和HIP编程模型,掌握其与CUDA的异同
- 研读vLLM、SGlang等框架源码,理解其性能优化点
面试指南
- 优化案例:按照问题背景→性能分析→瓶颈定位→优化措施→效果验证的框架回答,突出量化结果
- 经验描述:使用STAR法则(情境、任务、行动、结果),重点说明个人贡献
- 开放性技术问题:先阐述思路,再分步骤说明,体现逻辑性和深度
- 请描述一个你优化GPU kernel的案例,具体你做了什么?
- 如何定位分布式训练中的性能瓶颈?
- 你如何看待AMD ROCm与CUDA的竞争?
- 如果让你在vLLM中集成一个自定义kernel,你会怎么做?
- 在Linux环境下,如何调试一个性能问题?
职位点评
74
综合评分
AI芯片巨头,前沿GPU优化技术栈,高薪但工作生活平衡未知,职业发展潜力巨大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术成长、渴望接触前沿AI基础设施、对GPU优化有热情的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活50
使命价值85
薪资福利
70中等
AMD作为上市巨头,薪资水平有竞争力,但JD未透露具体数字,福利信息有限,稳定性较好。
薪资信号未披露(AI估算:35K-55K/月)
成长发展
90较高
职位涉及GPU性能优化、分布式推理等前沿技术,技能成长空间巨大,且与开源社区合作可提升行业影响力。
技术前沿前沿/新兴技术
技术栈CUDA、HIP、C++、Python、vLLM、PyTorch、ROCm、LLVM、Triton
成长机会advance your career
业务类型ambiguous
工作生活
50较低
要求现场办公,未提及弹性或远程,WLB信号不明显,可能面临较大工作强度。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
85较高
AMD致力于加速下一代计算体验,AI芯片行业前景广阔,工作具有明显的技术社会价值。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号build great products that accelerate next-generation computing experiences
创新程度积极采用新技术
超威半导体 的其他在招职位
相似职位推荐
Watch Jobs