AMD logo
超威半导体
AI Framework Engineer

AI Framework Engineer

发布于 大约 2 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Gpu
Hip
Pytorch
Sglang
Vllm
分布式系统
性能优化

AI 估算 · 35k–60k

AI框架工程师是高端技术岗,上海一线大厂及外企薪资较高,考虑AMD平台和GPU优化技能稀缺性,月薪3.5万至6万合理。

职位详情

关于这个职位

加入AMD上海团队,作为AI框架工程师,你将专注于深度学习框架(如vLLM、SGlang)在AMD GPU上的性能优化与开发,包括GPU内核优化、分布式训练与推理加速,并与开源社区紧密协作

这是一个技术深度高、与前沿AI紧密相关的岗位

最低要求

学术背景:计算机科学、计算机工程、电气工程或相关领域的学士和/或硕士学位

\n工作经验:3年以上专业技术软件开发经验,专注于GPU优化、性能工程和框架开发

工作职责

端到端优化:在主流框架(如vLLM和SGlang)上构建并优化端到端分布式推理(如P/D分离和Large-EP)和强化学习解决方案

\n与GPU库团队合作:与内部团队密切合作,分析和改进AMD GPU上的训练和推理性能
\n与开源维护者合作:与框架维护者互动,确保代码变更符合要求并向上游集成
\n在分布式计算环境中工作:在scale-up(多GPU)和scale-out(多节点)系统上优化深度学习性能
\n利用前沿编译器技术:利用先进的编译器技术提升深度学习性能
\n优化深度学习流水线:增强完整流水线,包括集成图编译器
\n软件工程最佳实践:应用稳健的工程原则,确保解决方案可靠、可维护

优先资格

GPU内核开发与优化:熟练使用HIP、CUDA和汇编(ASM)设计并优化深度学习GPU内核

熟悉AMD架构(GCN、RDNA)和底层编程
使用Compute Kernel (CK)、CUTLASS、Triton等工具提升多GPU和多平台性能
\n深度学习集成:具有将优化后的GPU性能集成到机器学习及LLM框架(如vLLM、SGlang、TensorFlow、PyTorch)中的经验,以加速模型训练和推理,关注扩展性和吞吐量
\n端到端解决方案优化:了解LLM和多模态的最新市场趋势,具备分布式推理(如P/D分离和Large-EP)和RL的扎实端到端性能调优经验
有Text to Video或Image to Video经验者优先
\n软件工程:精通Python和C++,具有调试、性能调优和测试设计经验
\n高性能计算:具有在异构计算集群上运行大规模工作负载的经验,优化效率和可扩展性
\n编译器优化:对编译器理论和工具(如LLVM和ROCm)有基础理解,用于内核和系统性能优化

AI 洞察

优缺点分析

优点

  • AMD是GPU和AI硬件巨头,技术平台顶尖,能接触前沿AI基础设施
  • 与开源社区合作,有助于建立个人技术品牌和影响力
  • 跨国企业文化和福利体系成熟,薪资待遇有竞争力
  • 高性能GPU优化难度大,需要深厚的底层知识和持续学习
  • 与开源社区协作可能涉及跨时区沟通,工作节奏较快
  • 岗位对综合能力要求高,需要同时掌握内核开发、框架集成和分布式系统

缺点 / 挑战

  • 工作内容深度聚焦性能优化,是极具挑战性和高价值的技术方向,可积累稀缺技能
  • 适合对底层计算、性能优化有强烈热情,享受技术挑战,并愿意在AI基础设施领域深耕的工程师

角色解读

  • 成为GPU计算和深度学习框架优化领域的专家,技术影响力覆盖公司内部和开源社区
  • 可向技术专家(如首席工程师)或技术管理(工程经理)方向发展,核心团队晋升空间大
  • 随着AI基础设施需求增长,该领域人才稀缺,职业前景广阔,可跨公司或跨行业转型
  • 负责在AMD GPU上优化深度学习框架的核心性能,包括内核、分布式训练和推理
  • 与内部GPU库团队和开源维护者紧密合作,确保优化代码向上游集成
  • 利用编译器技术(如LLVM、ROCm)和图编译器提升深度学习全流水线效率
  • 参与构建端到端的分布式推理和强化学习解决方案,如vLLM和SGlang
  • 扎实的C++和Python编程能力,熟悉Linux开发环境
  • 深入理解GPU架构和低层编程,熟练使用HIP、CUDA或汇编进行内核优化
  • 熟悉深度学习框架如PyTorch、TensorFlow,了解vLLM、SGlang等LLM推理框架
  • 具备分布式计算和高性能计算的经验,了解多GPU多节点扩展

申请策略

  • 在简历中明确写出你如何量化性能提升,如训练速度提升X%,推理时延降低Y%
  • 了解AMD GPU产品线及与NVIDIA的竞争格局,展现对公司的热情
  • 突出GPU内核优化经验,特别是使用HIP/CUDA的实战项目
  • 展示在深度学习框架(如PyTorch、vLLM)中的性能调优成果,量化提升的吞吐量或时延
  • 强调分布式计算和集群大规模训练/推理的经验
  • 如有开源贡献或编译器优化经历,重点体现
  • 熟悉AMD ROCm生态和HIP编程,可提前学习相关文档和示例
  • 深入学习vLLM、SGlang等LLM推理框架的架构和优化技巧

面试指南

  • 使用STAR原则:情境、任务、行动、结果,突出具体数字和影响
  • 围绕性能分析-定位瓶颈-优化-验证的循环,展示系统性思维
  • 体现团队协作和与外部沟通的能力,强调结果导向
  • 如何优化一个GPU内核?请举例说明你曾遇到并解决的关键性能瓶颈
  • 在分布式训练中,如何处理通信开销和负载不均衡?
  • 说说你对vLLM中P/D分离或Large-EP的理解,如何调优?
  • 如何与开源社区协作确保代码被接受?
  • 请描述你使用HIP或CUDA进行内存访问优化的经验

职位点评

75
综合评分

前沿AI框架优化岗位,技术成长极佳,薪资竞争力强,但灵活性一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合高度追求技术成长和个人能力提升的求职者,能接受现场办公和高压工作氛围。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值80

薪资福利

75中等

AMD作为全球半导体巨头,提供有竞争力的薪资和福利,但JD未明确数字,整体薪酬水平在市场中属于中上。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

90较高

该职位涉及GPU内核优化、编译器技术和前沿AI框架,技术成长空间极大,且与开源社区互动,有利于长期职业发展。

技术前沿前沿/新兴技术
技术栈GPU、HIP、CUDA、vLLM、SGlang、PyTorch、LLVM、ROCm、C++、Python
业务类型ambiguous

工作生活

50较低

工作地点在上海,但JD未提及远程或弹性办公,且高度技术性高强度工作,可能面临压力。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

80较高

AMD致力于推动AI和计算进步,其使命面向未来技术,工作社会意义和技术创新价值较高。

行业发展高速增长赛道
社会影响中性/一般
使命信号加速下一代计算体验、解决世界上最重要的挑战
创新程度积极采用新技术
Watch Jobs