
超威半导体
AI Framework Engineer
AI Framework Engineer
发布于 大约 2 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Gpu
Hip
Pytorch
Sglang
Vllm
分布式系统
性能优化
AI 估算 · 35k–60k
AI框架工程师是高端技术岗,上海一线大厂及外企薪资较高,考虑AMD平台和GPU优化技能稀缺性,月薪3.5万至6万合理。
职位详情
关于这个职位
加入AMD上海团队,作为AI框架工程师,你将专注于深度学习框架(如vLLM、SGlang)在AMD GPU上的性能优化与开发,包括GPU内核优化、分布式训练与推理加速,并与开源社区紧密协作
这是一个技术深度高、与前沿AI紧密相关的岗位
最低要求
学术背景:计算机科学、计算机工程、电气工程或相关领域的学士和/或硕士学位
\n工作经验:3年以上专业技术软件开发经验,专注于GPU优化、性能工程和框架开发
工作职责
端到端优化:在主流框架(如vLLM和SGlang)上构建并优化端到端分布式推理(如P/D分离和Large-EP)和强化学习解决方案
\n与GPU库团队合作:与内部团队密切合作,分析和改进AMD GPU上的训练和推理性能
\n与开源维护者合作:与框架维护者互动,确保代码变更符合要求并向上游集成
\n在分布式计算环境中工作:在scale-up(多GPU)和scale-out(多节点)系统上优化深度学习性能
\n利用前沿编译器技术:利用先进的编译器技术提升深度学习性能
\n优化深度学习流水线:增强完整流水线,包括集成图编译器
\n软件工程最佳实践:应用稳健的工程原则,确保解决方案可靠、可维护
优先资格
GPU内核开发与优化:熟练使用HIP、CUDA和汇编(ASM)设计并优化深度学习GPU内核
熟悉AMD架构(GCN、RDNA)和底层编程
使用Compute Kernel (CK)、CUTLASS、Triton等工具提升多GPU和多平台性能
\n深度学习集成:具有将优化后的GPU性能集成到机器学习及LLM框架(如vLLM、SGlang、TensorFlow、PyTorch)中的经验,以加速模型训练和推理,关注扩展性和吞吐量
\n端到端解决方案优化:了解LLM和多模态的最新市场趋势,具备分布式推理(如P/D分离和Large-EP)和RL的扎实端到端性能调优经验
有Text to Video或Image to Video经验者优先
\n软件工程:精通Python和C++,具有调试、性能调优和测试设计经验
\n高性能计算:具有在异构计算集群上运行大规模工作负载的经验,优化效率和可扩展性
\n编译器优化:对编译器理论和工具(如LLVM和ROCm)有基础理解,用于内核和系统性能优化
AI 洞察
优缺点分析
优点
- AMD是GPU和AI硬件巨头,技术平台顶尖,能接触前沿AI基础设施
- 与开源社区合作,有助于建立个人技术品牌和影响力
- 跨国企业文化和福利体系成熟,薪资待遇有竞争力
- 高性能GPU优化难度大,需要深厚的底层知识和持续学习
- 与开源社区协作可能涉及跨时区沟通,工作节奏较快
- 岗位对综合能力要求高,需要同时掌握内核开发、框架集成和分布式系统
缺点 / 挑战
- 工作内容深度聚焦性能优化,是极具挑战性和高价值的技术方向,可积累稀缺技能
- 适合对底层计算、性能优化有强烈热情,享受技术挑战,并愿意在AI基础设施领域深耕的工程师
角色解读
- 成为GPU计算和深度学习框架优化领域的专家,技术影响力覆盖公司内部和开源社区
- 可向技术专家(如首席工程师)或技术管理(工程经理)方向发展,核心团队晋升空间大
- 随着AI基础设施需求增长,该领域人才稀缺,职业前景广阔,可跨公司或跨行业转型
- 负责在AMD GPU上优化深度学习框架的核心性能,包括内核、分布式训练和推理
- 与内部GPU库团队和开源维护者紧密合作,确保优化代码向上游集成
- 利用编译器技术(如LLVM、ROCm)和图编译器提升深度学习全流水线效率
- 参与构建端到端的分布式推理和强化学习解决方案,如vLLM和SGlang
- 扎实的C++和Python编程能力,熟悉Linux开发环境
- 深入理解GPU架构和低层编程,熟练使用HIP、CUDA或汇编进行内核优化
- 熟悉深度学习框架如PyTorch、TensorFlow,了解vLLM、SGlang等LLM推理框架
- 具备分布式计算和高性能计算的经验,了解多GPU多节点扩展
申请策略
- 在简历中明确写出你如何量化性能提升,如训练速度提升X%,推理时延降低Y%
- 了解AMD GPU产品线及与NVIDIA的竞争格局,展现对公司的热情
- 突出GPU内核优化经验,特别是使用HIP/CUDA的实战项目
- 展示在深度学习框架(如PyTorch、vLLM)中的性能调优成果,量化提升的吞吐量或时延
- 强调分布式计算和集群大规模训练/推理的经验
- 如有开源贡献或编译器优化经历,重点体现
- 熟悉AMD ROCm生态和HIP编程,可提前学习相关文档和示例
- 深入学习vLLM、SGlang等LLM推理框架的架构和优化技巧
面试指南
- 使用STAR原则:情境、任务、行动、结果,突出具体数字和影响
- 围绕性能分析-定位瓶颈-优化-验证的循环,展示系统性思维
- 体现团队协作和与外部沟通的能力,强调结果导向
- 如何优化一个GPU内核?请举例说明你曾遇到并解决的关键性能瓶颈
- 在分布式训练中,如何处理通信开销和负载不均衡?
- 说说你对vLLM中P/D分离或Large-EP的理解,如何调优?
- 如何与开源社区协作确保代码被接受?
- 请描述你使用HIP或CUDA进行内存访问优化的经验
职位点评
75
综合评分
前沿AI框架优化岗位,技术成长极佳,薪资竞争力强,但灵活性一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合高度追求技术成长和个人能力提升的求职者,能接受现场办公和高压工作氛围。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值80
薪资福利
75中等
AMD作为全球半导体巨头,提供有竞争力的薪资和福利,但JD未明确数字,整体薪酬水平在市场中属于中上。
薪资信号未披露(AI估算:35K-60K/月)
成长发展
90较高
该职位涉及GPU内核优化、编译器技术和前沿AI框架,技术成长空间极大,且与开源社区互动,有利于长期职业发展。
技术前沿前沿/新兴技术
技术栈GPU、HIP、CUDA、vLLM、SGlang、PyTorch、LLVM、ROCm、C++、Python
业务类型ambiguous
工作生活
50较低
工作地点在上海,但JD未提及远程或弹性办公,且高度技术性高强度工作,可能面临压力。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
80较高
AMD致力于推动AI和计算进步,其使命面向未来技术,工作社会意义和技术创新价值较高。
行业发展高速增长赛道
社会影响中性/一般
使命信号加速下一代计算体验、解决世界上最重要的挑战
创新程度积极采用新技术
超威半导体 的其他在招职位
AI Software Engineer — High-Performance
超威半导体 · 上海市AI 估算 · 40k-70kAI Software Engineer — High-Performance GPU Communication
超威半导体 · 上海市AI 估算 · 35k-55kSys/Test Validation Engineer
超威半导体 · 上海市AI 估算 · 30k-50kDatacenter Server Solution Architect
超威半导体 · 深圳市AI 估算 · 25k-45kComponent Sales Account Manager
超威半导体 · 北京市AI 估算 · 45k-75k
相似职位推荐
Watch Jobs