
超威半导体
AI Framework Engineer
AI Framework Engineer
发布于 大约 1 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Cuda
Gpu
Hip
Llvm
Pytorch
Rocm
Tensorflow
分布式计算
AI 估算 · 30k–60k
AI GPU领域热需,资深岗位薪资较高,AMD为国际大厂,薪酬有竞争力。
职位详情
关于这个职位
作为AMD上海的AI框架工程师,你将负责优化TensorFlow和PyTorch等深度学习框架在AMD GPU上的性能,开发高效GPU内核,并参与跨GPU/节点的分布式性能优化
这是一个深度技术岗位,适合对GPU底层优化和高性能计算充满热情的经验工程师
最低要求
{计算机科学、计算机工程、电气工程或相关领域的硕士学位,5年以上技术软件开发专业经验,专注于GPU优化、性能工程和框架开发,熟练掌握C++和Python,具备Linux环境开发经验,具备较强的技术和分析能力,能够在团队协作和独立工作中表现出色,能够定义目标、管理开发工作并交付高质量解决方案,强大的问题解决能力、积极主动的态度,以及对软件工程最佳实践的深刻理解}
工作职责
{"优化深度学习框架:在开源仓库中优化和改进TensorFlow和PyTorch等框架在AMD GPU上的性能
",开发GPU内核:创建并优化GPU内核,以最大化特定AI操作的性能
,"开发与优化模型:针对AMD GPU性能设计和优化深度学习模型
","与GPU库团队协作:与内部团队紧密合作,分析和改进AMD GPU上的训练和推理性能
",与开源维护者协作:与框架维护者沟通,确保代码变更符合要求并集成上游
,在分布式计算环境中工作:在scale-up(多GPU)和scale-out(多节点)系统上优化深度学习性能
,利用前沿编译器技术:采用先进的编译器技术提升深度学习性能
,优化深度学习流水线:增强全流水线,包括集成图编译器
,软件工程最佳实践:应用扎实的工程原则,确保健壮、可维护的解决方案
,指导与引导:为初级团队成员提供指导,通过代码审查、知识共享和技术指导促进成长与协作
}
优先资格
{"GPU内核开发与优化:在使用HIP、CUDA和汇编(ASM)为AMD GPU设计优化深度学习内核方面有丰富经验
深入了解AMD架构(GCN、RDNA)和底层编程,利用Compute Kernel (CK)、CUTLASS和Triton等工具实现多GPU和多平台性能最大化
",深度学习集成:在将优化后的GPU性能集成到机器学习框架(如TensorFlow、PyTorch)方面有丰富经验,以加速模型训练和推理,关注扩展性和吞吐量
,软件工程:精通Python和C++,具备调试、性能调优和测试设计经验,确保高质量、可维护的软件解决方案
,高性能计算:在异构计算集群上运行大规模工作负载方面有丰富经验,优化效率和可扩展性
,编译器优化:对编译器和工具(如LLVM和ROCm)有深入理解,用于内核和系统性能优化
}
AI 洞察
优缺点分析
优点
- 与全球开源社区和内部顶尖团队合作,视野广阔
- AMD作为国际大厂,薪酬福利有竞争力,工作稳定
- 需要深入底层汇编和硬件架构,学习曲线陡峭
- 技术更新快,需要持续学习保持竞争力
缺点 / 挑战
- 处于AI和GPU加速的最前沿,技术挑战大,个人成长快
- 工作强度可能较高,需应对多团队协作和上游代码整合的压力
- 适合对底层性能优化有强烈兴趣、具备扎实C++和GPU编程经验、愿意在高强度技术环境中挑战自我的工程师
角色解读
- 从工程师成长为GPU优化专家,深入底层硬件和编译器技术
- 向技术领导方向晋级,带领团队主导大型GPU优化项目
- 可转向AI芯片架构设计、编译器开发或更底层的系统软件方向
- 优化TensorFlow和PyTorch在AMD GPU上的性能,包括内核开发和模型优化
- 与内部GPU库团队和开源社区合作,推动优化代码集成到上游框架
- 在分布式多GPU/多节点环境中提升训练和推理效率,解决性能瓶颈
- 利用编译器技术(如LLVM、图编译器)改进深度学习流水线的整体效率
- 精通C++和Python,具备Linux环境开发经验
- 熟悉GPU编程(HIP/CUDA)和架构(GCN/RDNA),有内核优化经验
- 了解深度学习框架的内部机制,能够进行性能分析和调优
- 掌握分布式计算和高性能计算知识,了解编译器原理
申请策略
- 在简历中体现对AMD技术的了解,特别是与NVIDIA CUDA的对比
- 准备好分享一两个深入的技术案例,展示问题解决思路
- 突出GPU内核优化项目经验,具体说明性能提升数据和使用的工具(如HIP、CUDA)
- 展示深度学习框架(PyTorch/TensorFlow)的集成或二次开发经历,涉及分布式训练更佳
- 强调C++和Python的熟练度,以及Linux下的调试和性能分析技能
- 如有开源贡献(如ROCm、PyTorch社区),务必列出
- 熟悉AMD ROCm生态和HIP编程,可提前学习相关文档
- 了解编译器基础知识,特别是LLVM和Graph Compiler
面试指南
- 用STAR法则:情景、任务、行动、结果,突出具体技术和数据
- 结构化分析:先定位问题,再设计优化方案,最后验证并迭代
- 展示协作能力:强调与团队/社区的沟通和代码评审经验
- 如何优化一个PyTorch算子使其在AMD GPU上跑得更快?
- 解释HIP和CUDA的区别,以及如何移植内核?
- 在多GPU分布式训练中,你如何定位性能瓶颈?
- 你如何与开源社区协作将优化代码合并到上游框架?
- 请描述一次你通过底层汇编优化提升性能的经历
职位点评
74
综合评分
国际大厂、前沿AI GPU优化,技术驱动,薪资好但工作强度未知
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术深度和职业成长、对GPU底层优化有热情的工程师,愿意接受现场办公和可能的加班。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活55
使命价值70
薪资福利
75中等
该职位位于AMD上海,资深岗位薪资水平较高,公司提供有竞争力的薪酬福利,但JD未披露具体数字。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
90较高
职位深度涉及GPU底层优化、编译器技术和AI框架,技术前沿且成长空间巨大,可快速积累稀缺经验。
技术前沿前沿/新兴技术
技术栈C++、Python、GPU、TensorFlow、PyTorch、HIP、CUDA、LLVM、ROCm、Triton
业务类型profit_center
工作生活
55较低
上海工作,现场办公,未提及弹性或远程,也未说明加班情况,生活平衡取决于团队实际。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
公司使命是加速下一代计算体验,职位推动AI基础设施发展,具有一定社会价值,但以技术实现为主。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号accelerate next-generation computing experiences、shape the future of AI
创新程度积极采用新技术
超威半导体 的其他在招职位
相似职位推荐
Watch Jobs