AMD logo
超威半导体
AI Software Engineer — High-Performance

AI Software Engineer — High-Performance

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Gpu
Hip
Llm
Llvm
Pytorch
Rocm
Sglang
Tensorflow

AI 估算 · 25k–45k

AI芯片领域技术门槛高,AMD为国际大厂,上海地区资深工程师薪资竞争力强,通常14-16薪。

职位详情

关于这个职位

该职位负责在AMD GPU上优化和开发深度学习框架,包括vLLM、SGlang等主流推理框架的性能调优

你将与GPU库团队及开源社区协作,利用编译器技术提升多GPU和多节点系统的训练/推理性能
适合具备C++/Python和GPU编程经验,对AI基础设施有热情的工程师

最低要求

THE PERSON: 具备扎实的C++开发技能,熟悉Linux环境,能在协作和独立工作环境中茁壮成长,能定义目标、管理开发工作并交付高质量解决方案

拥有出色的解决问题能力、积极主动的态度和良好的软件工程实践
ACADEMIC CREDENTIALS: 计算机科学、计算机工程、电气工程或相关领域的学士和/或硕士学位
年以上技术软件开发经验,专注GPU优化、性能工程和框架开发

工作职责

端到端优化: 在主流框架(如vLLM和SGlang)上构建和优化端到端分布式推理(如P/D分离和Large-EP)和强化学习解决方案

与GPU库团队合作: 与内部团队紧密合作,分析和提升AMD GPU上的训练和推理性能
与开源维护者合作: 与框架维护者沟通,确保代码变更符合要求并集成到上游
在分布式计算环境中工作: 在scale-up(多GPU)和scale-out(多节点)系统上优化深度学习性能
利用前沿编译器技术: 利用先进的编译器技术来提升深度学习性能
优化深度学习流水线: 增强全流水线,包括集成图编译器
软件工程最佳实践: 应用严谨的工程原则确保健壮、可维护的解决方案

优先资格

GPU Kernel开发与优化: 有使用HIP、CUDA和汇编(ASM)在AMD GPU上设计和优化深度学习kernel的经验

熟悉AMD架构(GCN, RDNA)和底层编程,利用Compute Kernel(CK)、CUTLASS和Triton等工具在多GPU和多平台上最大化AI操作性能
深度学习集成: 有将优化后的GPU性能集成到机器学习和大语言模型框架(如vLLM, SGlang, TensorFlow, PyTorch)中,加速模型训练和推理的经验,重点关注扩展和吞吐量
端到端解决方案优化: 理解LLM和多模态的最新市场趋势,在分布式推理(如P/D分离和Large-EP)和强化学习方面有扎实的动手E2E性能调优经验
有Text to Video或Image to Video经验者优先
软件工程: 熟练使用Python和C++,有调试、性能调优和测试设计经验,确保高质量、可维护的软件解决方案
高性能计算: 有在异构计算集群上运行大规模工作负载,优化效率和可扩展性的扎实经验
编译器优化: 对编译理论和工具(如LLVM和ROCm)有基础理解,用于kernel和系统性能优化

AI 洞察

优缺点分析

优点

  • 接触前沿AI技术和GPU底层优化,技术深度强
  • 公司是国际半导体巨头,平台大,与全球顶尖工程师合作
  • 工作内容直接影响AMD GPU在AI市场的竞争力,成就感强
  • 技术难度高,需要同时掌握硬件架构、编译器和深度学习框架

缺点 / 挑战

  • 开源社区协作要求较高的沟通和影响力,工作节奏可能较快
  • 多任务并行,需要应对复杂的性能瓶颈和调试问题
  • 适合对GPU编程和AI基础设施有浓厚兴趣,喜欢技术挑战,能适应快节奏的资深工程师

角色解读

  • 向资深性能工程专家或技术架构师方向发展,深入GPU底层优化
  • 可跨团队担任技术领导者,主导开源项目合作或框架集成
  • 在AI芯片行业,随着AMD ROCm生态发展,有广阔的职业晋升空间
  • 负责开发和优化深度学习框架在AMD GPU上的运行性能,包括推理和训练流程
  • 与内部GPU库团队和开源社区协作,将优化代码集成到主流的LLM框架(如vLLM、SGlang)中
  • 针对多GPU和多节点系统进行分布式性能调优,利用编译器技术提升整体效率
  • 参与端到端的AI解决方案优化,包括分布式推理和强化学习场景
  • 精通C++和Python,熟悉Linux开发环境
  • 具备GPU编程经验,熟悉CUDA/HIP或底层汇编优化
  • 了解深度学习框架(PyTorch、TensorFlow)和LLM推理框架(vLLM、SGLang)
  • 理解编译器原理和性能分析工具,如LLVM、ROCm

申请策略

  • 关注AMD的技术博客和开源仓库,了解公司技术方向
  • 准备展示你解决复杂性能问题的案例,用数据说话
  • 突出GPU kernel优化项目经验,包括使用CUDA/HIP或汇编的性能调优案例
  • 展示在深度学习框架(如PyTorch、vLLM)中集成优化代码的经历
  • 强调分布式系统性能调优的实际成果,包括多GPU/多节点扩展性数据
  • 如参与过开源项目贡献,务必在简历中体现
  • 熟悉AMD ROCm生态和HIP编程,可提前学习相关文档
  • 复习编译器优化技术(LLVM)和GPU架构(GCN/RDNA)

面试指南

  • 使用STAR法则:描述情境、任务、行动和结果,量化性能提升
  • 展示系统思考:从问题定义、工具选择、实验对比到最终方案
  • 强调团队协作和代码质量标准,体现开源合作意识
  • 请描述一次你优化GPU kernel的经验,如何分析性能瓶颈?
  • 如何将自定义优化集成到PyTorch或vLLM中?
  • 在分布式训练中,你如何解决多GPU通信瓶颈?
  • 谈谈你对AMD ROCm栈的理解,以及它与CUDA的差异
  • 如何确保你的代码能顺利合并到开源项目?

职位点评

75
综合评分

前沿AI/GPU技术,薪资有竞争力,发展空间大,但工作节奏可能偏快。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和行业前沿性的求职者,能接受一定工作压力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展88
工作生活60
使命价值80

薪资福利

70中等

薪资未公开,但公司为国际半导体巨头,薪酬竞争力强,福利完善。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

88较高

工作涉及GPU底层优化和前沿AI技术,技术深度高,成长空间大。

技术前沿前沿/新兴技术
技术栈C++、Python、GPU、CUDA、HIP、vLLM、SGlang、PyTorch、TensorFlow、LLVM、ROCm
业务类型ambiguous

工作生活

60中等

工作地点在上海,但工作模式未明确,外企通常弹性较好,但技术岗可能加班。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

AI芯片行业高速发展,工作推动AI技术落地,使命感和行业前景良好。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号加速下一代计算体验、塑造AI未来
创新程度积极采用新技术
Watch Jobs