
超威半导体
AI Software Development Eng.
AI Software Development Eng.
发布于 大约 14 小时前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Gpu优化
Hip
Llvm
Mlir
Pytorch
Rocm
Sglang
Tensorflow
AI 估算 · 35k–65k
资深GPU软件工程师稀缺,AI赛道火热,AMD技术平台强,北京薪资水平高,预估月薪3.5-6.5万。
职位详情
关于这个职位
该职位负责优化AMD GPU上的深度学习框架(如TensorFlow、PyTorch、SGLang),开发高性能GPU内核,并进行分布式系统优化
你将与编译器团队和开源社区协作,推动AI软件生态发展
适合对高性能计算和AI基础设施有热情的技术专家
最低要求
个人要求:
熟练的工程师,具备在Linux环境下进行C++开发的技术和分析能力
能在协作团队和独立工作环境中都能胜任,能够定义目标、管理开发工作并交付高质量解决方案
强大的问题解决能力、积极主动的方法,并深刻理解软件工程最佳实践
学历要求:
计算机科学、计算机工程、电子工程或相关领域的学士和/或硕士学位
工作职责
优化深度学习框架:通过开源仓库的上游贡献,提升TensorFlow、PyTorch和SGLang等框架在AMD GPU上的性能
开发和优化深度学习模型:对大规模训练和推理模型进行性能剖析和调优,以达到AMD硬件上的最佳性能
GPU内核开发:使用HIP、Triton或其他相关工具设计、实现和优化高性能GPU内核,以提升AI算子效率
与GPU库和编译器团队协作:与内部编译器和GPU数学库团队紧密合作,整合和调整内核级优化以符合全栈性能目标
贡献SGLang开发:支持SGLang LLM框架在AMD GPU平台上的优化、功能开发和扩展
分布式系统优化:在多GPU(scale-up)和多节点(scale-out)环境中调优和扩展性能,包括推理并行和集合通信策略
图编译器集成:通过图编译器(如XLA、TorchDynamo或自定义流水线)集成和优化运行时执行
开源合作:与外部维护者合作,理解框架需求,提出优化建议并有效地进行上游贡献
应用工程最佳实践:在调试、剖析、测试驱动开发和CI集成中应用现代软件工程实践
优先资格
优先经验:
强大的编程技能:精通C++和/或Python,具备调试、剖析和优化性能关键代码的能力
SGLang和LLM优化:具有SGLang或类似LLM推理框架的扎实实践经验者优先
编译器和GPU架构知识:具有编译器设计背景或熟悉LLVM、MLIR或ROCm等技术者优先
异构系统工作负载:具有在大规模异构集群(CPU+GPU)上使用分布式训练或推理策略运行和扩展工作负载的专业经验
AI框架集成:具有深度学习框架(如PyTorch或TensorFlow)的集成优化经验或贡献
GPU计算:熟悉HIP、CUDA或其他GPU编程模型
具有GCN/CDNA架构经验者优先
AI 洞察
优缺点分析
优点
- AMD GPU生态迅速崛起,公司平台强大,与知名开源社区协作
- 高薪高福利,外资企业工作文化相对开放
- 能接触从内核到系统的全栈技术,技能积累深厚
- 技术难度大,需要同时掌握框架、编译器和硬件知识
- 相比互联网大厂,国内AMD团队规模较小,内部晋升路径可能有限
- 适合对高性能计算充满热情,擅长底层优化,愿意在技术领域深耕的工程师
缺点 / 挑战
- 处于AI基础设施前沿,技术挑战大,成长空间广阔
- 开源社区协作需要沟通和长期投入,工作压力可能较大
角色解读
- 从GPU内核优化专家向AI系统架构师发展,负责更大规模的训练推理系统设计
- 深入编译器底层,成为编译器与硬件协同设计专家
- 在开源社区建立影响力,成长为技术领袖,参与行业标准制定
- 优化深度学习框架(如TensorFlow、PyTorch、SGLang)在AMD GPU上的性能,通过上游贡献开源代码
- 开发和优化大规模训练与推理模型,进行性能剖析和调优
- 使用HIP、Triton等工具设计实现高性能GPU内核,提升AI算子效率
- 与编译器和GPU数学库团队协作,集成图编译器(如XLA、TorchDynamo)并优化分布式系统
- 精通C++和Python,能在Linux环境下进行性能关键代码的调试、剖析和优化
- 熟悉GPU编程模型(HIP、CUDA)和深度学习框架内部机制
- 了解编译器技术(LLVM、MLIR)或GPU架构(GCN/CDNA)者优先
- 具备分布式训练和推理的调优经验,熟悉SGLang等LLM推理框架
申请策略
- 调研AMD ROCm软件栈,了解其与CUDA生态的差异
- 准备深入的技术面试,可能包含现场编程和系统设计
- 突出GPU相关项目经验,如CUDA/HIP内核优化、性能调优案例
- 展示对PyTorch/TensorFlow内部机制的理解和实际贡献
- 强调分布式训练或推理系统经验,附上具体性能提升数据
- 如有开源贡献,列出PR或issue链接
- 系统学习HIP/CUDA编程模型,动手实现算子内核
- 了解LLVM/MLIR基础,熟悉图编译器工作流程
面试指南
- 对于性能优化问题,采用“剖析-定位-优化-验证”的框架,给出量化指标
- 对于设计问题,从需求分析、硬件特性、算法选择、实现细节逐步展开
- 对于开源协作问题,强调沟通、测试和文档的重要性
- 如何优化一个PyTorch算子性能?请给出具体步骤
- 解释HIP与CUDA的异同,以及如何转换
- 描述你在分布式训练中遇到的通信瓶颈及解决方案
- 如何为深度学习框架设计一个高效的GPU内核?
- 谈谈你对MLIR或XLA的理解
职位点评
73
综合评分
前沿GPU软件优化专家岗位,技术成长空间大,薪资未明但平台好,现场办公需接受一定强度。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和职业成长,对工作生活平衡要求不高的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活55
使命价值75
薪资福利
70中等
薪资水平未披露但预计具有竞争力,AMD作为上市大公司福利完善,但北京生活成本高,相对互联网大厂可能略保守。
薪资信号未披露(AI估算:35K-65K/月)
成长发展
90较高
技术栈前沿(GPU、编译器、AI框架),学习资源丰富,与开源社区深度协作,职业发展空间大。
技术前沿前沿/新兴技术
技术栈C++、Python、TensorFlow、PyTorch、SGLang、HIP、CUDA、ROCm、LLVM、MLIR、XLA、TorchDynamo
业务类型ambiguous
工作生活
55较低
仅现场办公,无弹性或远程信号,工作强度未知,但技术岗可能面临项目压力。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
AMD的使命是加速下一代计算体验,推动AI发展,工作具有技术上的使命感,但社会影响间接。
行业发展高速增长赛道
社会影响中性/一般
使命信号build great products that accelerate next-generation computing experiences、solve the world’s most important challenges、shape the future of AI
创新程度积极采用新技术
超威半导体 的其他在招职位
相似职位推荐
Watch Jobs