
超威半导体
AI Software Engineer — High-Performance
AI Software Engineer — High-Performance
发布于 大约 14 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
仅现场办公
本科
机器学习工程
Cuda
Gpu
Hip
Llm
Llvm
Pytorch
Rocm
Sglang
Tensorflow
AI 估算 · 25k–45k
AI芯片领域技术门槛高,AMD为国际大厂,上海地区资深工程师薪资竞争力强,通常14-16薪。
职位详情
关于这个职位
该职位负责在AMD GPU上优化和开发深度学习框架,包括vLLM、SGlang等主流推理框架的性能调优
你将与GPU库团队及开源社区协作,利用编译器技术提升多GPU和多节点系统的训练/推理性能
适合具备C++/Python和GPU编程经验,对AI基础设施有热情的工程师
最低要求
THE PERSON: 具备扎实的C++开发技能,熟悉Linux环境,能在协作和独立工作环境中茁壮成长,能定义目标、管理开发工作并交付高质量解决方案
拥有出色的解决问题能力、积极主动的态度和良好的软件工程实践
ACADEMIC CREDENTIALS: 计算机科学、计算机工程、电气工程或相关领域的学士和/或硕士学位
年以上技术软件开发经验,专注GPU优化、性能工程和框架开发
工作职责
端到端优化: 在主流框架(如vLLM和SGlang)上构建和优化端到端分布式推理(如P/D分离和Large-EP)和强化学习解决方案
与GPU库团队合作: 与内部团队紧密合作,分析和提升AMD GPU上的训练和推理性能
与开源维护者合作: 与框架维护者沟通,确保代码变更符合要求并集成到上游
在分布式计算环境中工作: 在scale-up(多GPU)和scale-out(多节点)系统上优化深度学习性能
利用前沿编译器技术: 利用先进的编译器技术来提升深度学习性能
优化深度学习流水线: 增强全流水线,包括集成图编译器
软件工程最佳实践: 应用严谨的工程原则确保健壮、可维护的解决方案
优先资格
GPU Kernel开发与优化: 有使用HIP、CUDA和汇编(ASM)在AMD GPU上设计和优化深度学习kernel的经验
熟悉AMD架构(GCN, RDNA)和底层编程,利用Compute Kernel(CK)、CUTLASS和Triton等工具在多GPU和多平台上最大化AI操作性能
深度学习集成: 有将优化后的GPU性能集成到机器学习和大语言模型框架(如vLLM, SGlang, TensorFlow, PyTorch)中,加速模型训练和推理的经验,重点关注扩展和吞吐量
端到端解决方案优化: 理解LLM和多模态的最新市场趋势,在分布式推理(如P/D分离和Large-EP)和强化学习方面有扎实的动手E2E性能调优经验
有Text to Video或Image to Video经验者优先
软件工程: 熟练使用Python和C++,有调试、性能调优和测试设计经验,确保高质量、可维护的软件解决方案
高性能计算: 有在异构计算集群上运行大规模工作负载,优化效率和可扩展性的扎实经验
编译器优化: 对编译理论和工具(如LLVM和ROCm)有基础理解,用于kernel和系统性能优化
AI 洞察
优缺点分析
优点
- 接触前沿AI技术和GPU底层优化,技术深度强
- 公司是国际半导体巨头,平台大,与全球顶尖工程师合作
- 工作内容直接影响AMD GPU在AI市场的竞争力,成就感强
- 技术难度高,需要同时掌握硬件架构、编译器和深度学习框架
缺点 / 挑战
- 开源社区协作要求较高的沟通和影响力,工作节奏可能较快
- 多任务并行,需要应对复杂的性能瓶颈和调试问题
- 适合对GPU编程和AI基础设施有浓厚兴趣,喜欢技术挑战,能适应快节奏的资深工程师
角色解读
- 向资深性能工程专家或技术架构师方向发展,深入GPU底层优化
- 可跨团队担任技术领导者,主导开源项目合作或框架集成
- 在AI芯片行业,随着AMD ROCm生态发展,有广阔的职业晋升空间
- 负责开发和优化深度学习框架在AMD GPU上的运行性能,包括推理和训练流程
- 与内部GPU库团队和开源社区协作,将优化代码集成到主流的LLM框架(如vLLM、SGlang)中
- 针对多GPU和多节点系统进行分布式性能调优,利用编译器技术提升整体效率
- 参与端到端的AI解决方案优化,包括分布式推理和强化学习场景
- 精通C++和Python,熟悉Linux开发环境
- 具备GPU编程经验,熟悉CUDA/HIP或底层汇编优化
- 了解深度学习框架(PyTorch、TensorFlow)和LLM推理框架(vLLM、SGLang)
- 理解编译器原理和性能分析工具,如LLVM、ROCm
申请策略
- 关注AMD的技术博客和开源仓库,了解公司技术方向
- 准备展示你解决复杂性能问题的案例,用数据说话
- 突出GPU kernel优化项目经验,包括使用CUDA/HIP或汇编的性能调优案例
- 展示在深度学习框架(如PyTorch、vLLM)中集成优化代码的经历
- 强调分布式系统性能调优的实际成果,包括多GPU/多节点扩展性数据
- 如参与过开源项目贡献,务必在简历中体现
- 熟悉AMD ROCm生态和HIP编程,可提前学习相关文档
- 复习编译器优化技术(LLVM)和GPU架构(GCN/RDNA)
面试指南
- 使用STAR法则:描述情境、任务、行动和结果,量化性能提升
- 展示系统思考:从问题定义、工具选择、实验对比到最终方案
- 强调团队协作和代码质量标准,体现开源合作意识
- 请描述一次你优化GPU kernel的经验,如何分析性能瓶颈?
- 如何将自定义优化集成到PyTorch或vLLM中?
- 在分布式训练中,你如何解决多GPU通信瓶颈?
- 谈谈你对AMD ROCm栈的理解,以及它与CUDA的差异
- 如何确保你的代码能顺利合并到开源项目?
职位点评
75
综合评分
前沿AI/GPU技术,薪资有竞争力,发展空间大,但工作节奏可能偏快。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和行业前沿性的求职者,能接受一定工作压力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展88
工作生活60
使命价值80
薪资福利
70中等
薪资未公开,但公司为国际半导体巨头,薪酬竞争力强,福利完善。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
88较高
工作涉及GPU底层优化和前沿AI技术,技术深度高,成长空间大。
技术前沿前沿/新兴技术
技术栈C++、Python、GPU、CUDA、HIP、vLLM、SGlang、PyTorch、TensorFlow、LLVM、ROCm
业务类型ambiguous
工作生活
60中等
工作地点在上海,但工作模式未明确,外企通常弹性较好,但技术岗可能加班。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
AI芯片行业高速发展,工作推动AI技术落地,使命感和行业前景良好。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号加速下一代计算体验、塑造AI未来
创新程度积极采用新技术
超威半导体 的其他在招职位
相似职位推荐
Watch Jobs