AMD logo
超威半导体
GPU Kernel Performance Engineer

GPU Kernel Performance Engineer

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
无经验要求
全职员工
仅现场办公
本科
研究与开发 (研发)
Cuda
Gpu
Machine Learning
Pytorch
Rocm
Tensorflow
并行计算
性能优化

AI 估算 · 15k–25k

校招GPU性能岗技术前沿,AMD为国际大厂,薪资有竞争力,参考上海同级别企业校招水平。

职位详情

关于这个职位

该职位是AMD ROCm核心团队面向新毕业生的GPU内核性能工程师岗位

你将专注于开发和优化机器学习内核,提升在AMD GPU上的性能与效率
工作涉及与跨团队协作,设计新算法,并参与代码审查与测试
适合对GPU编程和机器学习底层优化有热情的应届生

最低要求

Bachelor or above degree in Computer Science, Electrical Engineering, or related field.

工作职责

Develop and optimize ML kernels with focus on performance and scalability.

Collaborate with cross-functional teams to understand requirements and deliver high-quality software components.
Assist in design and implementation of new ML algorithms and frameworks.
Participate in code reviews, testing, and debugging processes to ensure the delivery of reliable software.
Keep up-to-date with latest advancements in machine learning and hardware optimization techniques.

优先资格

Strong foundation in machine learning concepts and algorithms.

Experience in programming languages such as C++, Python, or similar.
Familiarity with GPU programming and parallel computing, like CUDA or ROCm.
Experience with ML frameworks like TensorFlow, PyTorch, or similar.
Excellent problem-solving skills and attention to detail.
Ability to work in a team-oriented environment and excellent communication skills.

AI 洞察

优缺点分析

优点

  • 加入AMD,参与AI和GPU前沿技术,接触全球顶尖团队
  • 从事底层性能优化,技术深度高,积累核心竞争力
  • ROCm开源平台提供良好的学习和发展机会
  • 技术深度要求高,需要持续学习GPU架构和ML知识
  • 竞争激烈,工作强度可能较大,需具备抗压能力
  • 适合对GPU编程和机器学习有浓厚兴趣,喜欢底层性能优化,愿意深入技术细节的应届生

缺点 / 挑战

暂无明显挑战项

角色解读

  • 从初级性能工程师成长为高级GPU内核优化专家
  • 可转向AI算法研发或系统架构方向
  • 在AMD内部可晋升为技术主管或架构师
  • 开发和优化机器学习内核,提升在AMD GPU上的性能和可扩展性
  • 与跨团队协作,理解需求并交付高质量的软件组件
  • 参与新ML算法和框架的设计与实现
  • 进行代码审查、测试和调试,确保软件可靠性
  • 精通C++或Python,具备扎实的编程基础
  • 熟悉GPU编程和并行计算,如CUDA或ROCm
  • 掌握机器学习框架TensorFlow或PyTorch
  • 具备优秀的问题解决能力和细节关注

申请策略

  • 了解AMD的ROCm生态和ML加速库,准备相关技术问题
  • 在面试中展示对性能优化的热情和系统性思维
  • 突出GPU相关项目经验,如CUDA/ROCm编程、并行计算优化
  • 展示ML框架使用经验,如PyTorch自定义算子或TensorFlow性能调优
  • 强调C++/Python技能和代码质量意识
  • 如有相关实习或开源贡献,重点说明
  • 学习AMD ROCm平台和GPU架构(如CDNA)
  • 强化C++性能优化技巧,如内存管理和多线程

面试指南

  • 从内存访问模式、并行度、计算效率角度分析,给出具体优化策略如共享内存、向量化
  • 结合硬件特性(如AMD GPU架构)说明优化原理
  • 如何优化一个CUDA kernel以提升内存带宽利用率?
  • 解释GPU warp调度和bank conflict
  • PyTorch中如何自定义一个CUDA算子?
  • 手写一个简单矩阵乘法的GPU实现
  • 什么是ROCm?与CUDA的异同?
  • 复习GPU编程模型(CUDA/ROCm),重点掌握线程层次和内存层次

职位点评

73
综合评分

GPU内核校招,前沿技术栈,发展空间大,但工作强度可能较高。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
适合注重技术成长和行业前景,对薪资和工作强度有一定容忍度的应届生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值85

薪资福利

70中等

薪资未明确披露,但作为国际大厂校招,通常处于市场中上水平,另有福利(未在JD中具体说明)。

薪资信号未披露(AI估算:15K-25K/月)

成长发展

85较高

职位涉及GPU和ML前沿技术,提供深度技术成长机会,但JD未明确提及晋升路径或培训。

技术前沿前沿/新兴技术
技术栈GPU、CUDA、ROCm、Machine Learning、Parallel Computing
业务类型ambiguous

工作生活

50较低

工作地点在上海,未提及远程或弹性办公,且AMD作为硬件公司多为现场办公,工作强度可能较大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

AI和GPU行业高速增长,AMD致力于加速下一代计算,具有正向社会影响力。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号accelerate next-generation computing experiences、solve the world’s most important challenges
创新程度积极采用新技术
Watch Jobs