AMD logo
超威半导体
Software Development Engineer - AI Frameworks, GPU SW Performance

Software Development Engineer - AI Frameworks, GPU SW Performance

发布于 大约 15 小时前

普通员工/个人贡献者

北京市
高级经验
全职员工
仅现场办公
本科
软件工程
Cuda
Hip
Llm
Pytorch
Sglang
Vllm
Gpu Kernels

AI 估算 · 30k–50k

外企GPU/AI框架高级工程师,技术壁垒高,北京市场薪资竞争力强,月薪3-5万合理。

职位详情

关于这个职位

该职位是AMD中国北京的AI框架工程师,负责优化和开发PyTorch、vLLM等深度学习框架在AMD GPU上的性能,需要与开源社区和内部团队紧密合作,推动AI推理和训练的效率提升

适合有GPU编程和AI框架经验的资深工程师

最低要求

BS, MS or PhD in Computer Science, Computer Engineering, Electrical Engineering, or related technical fields.

工作职责

Optimize Deep Learning Frameworks: Enhance and optimize frameworks like PyTorch, vLLM, SGLang for AMD GPUs in open-source repositories.

Develop GPU Kernels: Create and optimize GPU kernels to maximize performance for specific AI operations.
Develop & Optimize Models: Design and optimize deep learning models using quantization specifically for AMD GPU performance.
Collaborate with GPU Library Teams: Work closely with internal teams to analyze and improve training and inference performance on AMD GPUs.
Collaborate with Open-Source Maintainers: Engage with framework maintainers to ensure code changes are aligned with requirements and integrated upstream.
Software Engineering Best Practices: Apply sound engineering principles to ensure robust, maintainable solutions.

优先资格

GPU Kernel Development & Optimization: Experienced in designing and optimizing GPU kernels for deep learning on AMD GPUs using HIP, CUDA, and assembly (ASM). Strong knowledge of AMD architectures (GCN, RDNA) and low-level programming to maximize performance for AI operations, leveraging tools like Compute Kernel (CK), CUTLASS, and Triton for multi-GPU and multi-platform performance.

Experience with AI software framework, such as PyTorch, vLLM, SGLang, benchmarking and profiling.
Experience using profiling and benchmark tooling for large models.
Experience with model optimization, such as low-precision quantization (MXFP4, FP8, INT4), sparsity.
Solid understanding of model architectures, LLMs, MoE, diffusion.
Proficient in C++ programming.
Experience developing and debugging in Python.
Team player and ready to work with a geographically distributed team.

AI 洞察

优缺点分析

优点

  • 身处AI浪潮核心,技术前沿性强,能接触到最新GPU架构和AI框架
  • AMD作为GPU巨头,平台大,资源丰富,有利于积累行业影响力
  • 工作涉及开源社区,可提升个人技术品牌和协作能力
  • 技术门槛高,需要同时掌握框架、GPU编程和模型优化,学习曲线陡峭
  • 性能优化工作对结果要求严苛,需持续关注细节和迭代

缺点 / 挑战

  • 跨时区协作可能存在沟通和跟进压力
  • 适合有3年以上GPU编程和AI框架经验的工程师,对性能优化充满热情,愿意拥抱开源和前沿技术挑战

角色解读

  • 技术专家路线:成为AI框架优化领域的权威,主导关键项目
  • 技术管理路线:可转向带领小团队,负责技术方向
  • 跨领域发展:在AMD内部转岗至AI研究或系统架构团队
  • 优化PyTorch、vLLM等AI框架在AMD GPU上的性能,涉及内核开发和模型量化
  • 与开源社区维护者合作,将代码变更集成到上游仓库
  • 与内部GPU库团队协作,分析和提升训练与推理效率
  • 精通C++和Python,具备GPU编程经验(HIP/CUDA)
  • 深入理解深度学习框架架构,如PyTorch内部机制
  • 熟悉LLM、MoE等模型架构及低精度量化技术

申请策略

  • 关注AMD的开源仓库和官方博客,了解技术方向
  • 准备一个GPU优化的案例分析,展示问题定位和解决思路
  • 突出GPU内核优化项目经验,特别是使用HIP/CUDA的具体成果
  • 强调对PyTorch等框架的贡献或深入修改经历
  • 展示在模型量化或LLM性能优化方面的实际工作
  • 提前熟悉vLLM、SGLang等新兴推理框架的代码结构
  • 系统学习AMD GPU架构(GCN/RDNA)和ROCm生态工具

面试指南

  • 结构化描述:问题定义、分析工具、具体优化手段(如融合内核、访存优化)、量化结果
  • 展示技术深度:不仅要会优化,还要理解底层硬件特性(如SM、warp调度)
  • 体现协作能力:说明如何协调跨团队或开源社区资源
  • 请描述你如何优化一个PyTorch算子在GPU上的性能
  • 解释GPU内核中的内存层次结构及优化策略
  • 如何进行大语言模型的推理性能分析和瓶颈定位
  • 你如何与开源社区协作并确保代码合并?
  • 低精度量化(如FP8、INT4)的挑战及其解决方案

职位点评

71
综合评分

AI框架前沿技术,高成长性,但WLB一般且未明确薪资。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合以技术成长和前沿挑战为核心动机的求职者,能接受一定的现场办公约束。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值80

薪资福利

70中等

AMD作为外企提供有竞争力的薪资福利,但未明确具体数字,且北京生活成本高,补偿性动机中等。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

该职位聚焦AI/GPU前沿技术,涉及最新框架和优化方法,成长空间极大,开发者能够深度技术积累。

技术前沿前沿/新兴技术
技术栈PyTorch、vLLM、SGLang、HIP、CUDA、Quantization、LLM
业务类型ambiguous

工作生活

40较低

仅现场办公,未提及弹性工作或福利,工作强度暗示不明显但技术要求高可能导致加班。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

AI行业处于高速增长期,AMD在GPU竞争中扮演关键角色,对社会有正向影响,但直接使命感不强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs