AMD logo
超威半导体
AI Software Engineer — High-Performance

AI Software Engineer — High-Performance

发布于 大约 2 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Gpu
Kvcache
Moe
Pytorch
Rdma
Rocm
Sglang
Vllm

AI 估算 · 40k–70k

高性能GPU通信领域稀缺技能,上海资深岗位薪资高于市场均值。

职位详情

关于这个职位

该职位是AMD系统软件团队的高级工程师,专注于GPU高性能通信框架MORI的研发

你将负责将MORI集成到SGLang、vLLM等主流LLM推理框架中,支持MoE专家并行和Prefill/Decode分离,涉及RDMA、GPU Direct等前沿技术
适合对AI推理基础设施有深厚兴趣的技术专家

最低要求

深入了解至少一个主流LLM推理框架(SGLang, vLLM, TensorRT-LLM或同等),包括调度器、注意力后端、KVCache管理和分布式执行引擎

对LLM服务的深入理解:MoE专家并行、Prefill/Decode分离、KVCache复用、张量/流水线/序列并行
扎实的C++和Python技能,能够熟练使用C++/HIP/Python混合代码库和PyTorch自定义算子扩展
有参与大型开源项目的经验:上游PR、代码审查、跨团队协调

工作职责

推理框架集成:负责将MORI原语端到端集成到SGLang和vLLM中,包括Python算子API、MoE前向传播中的MORI-EP dispatch/combine,以及KVCache传输管道中的MORI-IO

MORI-UMBP:将分层KVCache存储和分布式键值访问集成到推理服务栈中
PD分离:将MORI-IO集成到Prefill/Decode路径中,实现通过GPU-direct RDMA的高吞吐KVCache传输
专家并行(EP):在SGLang和vLLM中落地并维护MORI-EP,涵盖调度、路由和EPLB,支持8-64 GPU上的MoE模型(如DeepSeek V3)
MORI-SHMEM:集成并维护对称内存运行时,支持所有MORI组件,包括管理对称GPU内存分配、RDMA传输初始化(IB、AINIC、Thor2)、P2P/XGMI地址转换,以及通过MORI-IR bitcode为GPU内核提供设备端状态
性能基准测试:设计并运行端到端基准测试(吞吐量、TTFT、ITL),覆盖EP和PD分离配置,并根据剖析数据进行性能优化

优先资格

RDMA概念:verbs API、队列对、完成队列、内存注册、GPUDirect Async (IBGDA)

集合通信库(NCCL, RCCL, MPI)及其在分布式系统中的应用
GPU集群网络拓扑:XGMI/NVLink(节点内),InfiniBand/RoCE(节点间),及其对MoE全对全模式的影响
NIC供应商生态(Mellanox ConnectX, AMD Pollara/AINIC, Broadcom Thor2)及用户态驱动程序库
使用rocprofv3、Perfetto、ibstat/perfquery分析网络工作负载性能
ROCm、hipcc或AMD GPU架构经验

AI 洞察

优缺点分析

优点

  • 参与前沿的AI基础设施研发,接触最先进的GPU通信和推理优化技术
  • 代码直接贡献到SGLang和vLLM等大热开源项目,获得业内高度认可
  • AMD作为全球半导体巨头,提供完善的研发资源和技术支持,学习曲线陡峭
  • 团队具备深厚的RDMA和GPU内核经验,是技术成长的绝佳环境
  • 工作可能面临高强度的性能优化需求,需要处理复杂的分布式系统问题
  • 适合对AI系统底层技术有强烈兴趣,具备扎实编程功底和较强学习能力,乐于在开源社区中钻研的工程师

缺点 / 挑战

  • 技术要求极高,需要同时掌握LLM推理、RDMA网络和GPU编程,学习压力大
  • 开源社区协作需要跨时区沟通,对沟通和协调能力有较高要求

角色解读

  • 从IC向技术专家或团队负责人发展,主导GPU通信和AI推理基础设施的关键项目
  • 成为开源社区核心贡献者,在SGLang/vLLM等项目中建立个人技术影响力
  • 在AMD内部可转向系统架构师或技术管理方向,深入半导体行业的软硬件协同发展
  • 负责MORI框架在SGLang和vLLM中的端到端集成,优化MoE专家并行和PD分离场景下的GPU通信效率
  • 深入理解KVCache管理和分布式执行引擎,设计并实现高效的MORI-IO和MORI-SHMEM运行时
  • 参与性能基准测试和分析,基于profiling数据推动推理性能的持续优化
  • 通过开源PR贡献代码,与全球开发者协作,保持MORI在AI推理基础设施的领先性
  • 精通C++和Python,并能编写高性能的GPU算子(如PyTorch自定义扩展)
  • 熟悉至少一个主流LLM推理框架(SGLang、vLLM等)的内部机制,包括调度、内存管理和分布式执行
  • 了解分布式系统、RDMA通信和GPU架构(尤其是AMD ROCm/HIP)
  • 具备开源协作经验,能进行代码审查和跨团队沟通

申请策略

  • 在求职信中说明你对AI推理基础设施的热情,并提及你在相关开源项目的参与经历
  • 关注AMD在AI领域的战略动向,在面试中表现出对业务的深入理解
  • 突出你在LLM推理框架(如vLLM、SGLang)中的实际工作和贡献,包括PR、性能优化案例
  • 强调C++/Python编程能力,特别是涉及GPU编程(CUDA/HIP/Rocm)或高性能计算的项目
  • 展示你对分布式系统、网络通信(RDMA、NCCL)的理解和实践经验
  • 如有开源项目维护经验,请附上相关链接和具体贡献
  • 熟悉SGLang和vLLM的源码,尝试为它们贡献代码或修改
  • 学习RDMA编程基础(如InfiniBand verbs),了解GPUDirect等技术

面试指南

  • 用STAR法则描述项目经历,突出你的技术决策和带来的成果
  • 对于系统设计问题,先阐述整体架构,再深入具体细节,同时考虑权衡取舍
  • 展示你对开源社区的贡献,强调协作和代码质量
  • 请详细解释你在SGLang或vLLM中做过的工作,特别是性能优化方面的案例
  • 什么是MoE专家并行?你如何设计它的all-to-all通信?
  • 描述一次你调试分布式系统性能问题的经历
  • RDMA有哪些关键概念?如何实现GPU间的直接通信?
  • 你如何看待AMD ROCm与NVIDIA CUDA的竞争?

职位点评

69
综合评分

前沿AI推理基础设施研发,技术成长空间极大,薪资和WLB待定。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术挑战和职业成长的工程师,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活50
使命价值75

薪资福利

60中等

薪资未在JD中透露,但AMD作为跨国半导体巨头,提供有竞争力的薪酬和福利,不过具体待遇需面试了解。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

该职位处于AI基础设施的最前沿,能深入学习GPU通信、推理框架和分布式系统,技能成长空间极大。

技术前沿前沿/新兴技术
技术栈RDMA、GPU、SGLang、vLLM、MoE、KVCache、ROCm、HIP、PyTorch
业务类型ambiguous

工作生活

50较低

工作地点在上海,但JD未提及弹性工作或远程,可能以办公室办公为主,WLB情况未知。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

推动AI高性能计算的发展,虽然不直接面向普通用户,但对行业有显著促进作用和战略意义。

行业发展高速增长赛道
社会影响中性/一般
使命信号accelerate next-generation computing experiences
创新程度开拓性创新(行业首创)
Watch Jobs