
超威半导体
AI Software Engineer — High-Performance
AI Software Engineer — High-Performance
发布于 大约 2 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Gpu
Kvcache
Moe
Pytorch
Rdma
Rocm
Sglang
Vllm
AI 估算 · 40k–70k
高性能GPU通信领域稀缺技能,上海资深岗位薪资高于市场均值。
职位详情
关于这个职位
该职位是AMD系统软件团队的高级工程师,专注于GPU高性能通信框架MORI的研发
你将负责将MORI集成到SGLang、vLLM等主流LLM推理框架中,支持MoE专家并行和Prefill/Decode分离,涉及RDMA、GPU Direct等前沿技术
适合对AI推理基础设施有深厚兴趣的技术专家
最低要求
深入了解至少一个主流LLM推理框架(SGLang, vLLM, TensorRT-LLM或同等),包括调度器、注意力后端、KVCache管理和分布式执行引擎
对LLM服务的深入理解:MoE专家并行、Prefill/Decode分离、KVCache复用、张量/流水线/序列并行
扎实的C++和Python技能,能够熟练使用C++/HIP/Python混合代码库和PyTorch自定义算子扩展
有参与大型开源项目的经验:上游PR、代码审查、跨团队协调
工作职责
推理框架集成:负责将MORI原语端到端集成到SGLang和vLLM中,包括Python算子API、MoE前向传播中的MORI-EP dispatch/combine,以及KVCache传输管道中的MORI-IO
MORI-UMBP:将分层KVCache存储和分布式键值访问集成到推理服务栈中
PD分离:将MORI-IO集成到Prefill/Decode路径中,实现通过GPU-direct RDMA的高吞吐KVCache传输
专家并行(EP):在SGLang和vLLM中落地并维护MORI-EP,涵盖调度、路由和EPLB,支持8-64 GPU上的MoE模型(如DeepSeek V3)
MORI-SHMEM:集成并维护对称内存运行时,支持所有MORI组件,包括管理对称GPU内存分配、RDMA传输初始化(IB、AINIC、Thor2)、P2P/XGMI地址转换,以及通过MORI-IR bitcode为GPU内核提供设备端状态
性能基准测试:设计并运行端到端基准测试(吞吐量、TTFT、ITL),覆盖EP和PD分离配置,并根据剖析数据进行性能优化
优先资格
RDMA概念:verbs API、队列对、完成队列、内存注册、GPUDirect Async (IBGDA)
集合通信库(NCCL, RCCL, MPI)及其在分布式系统中的应用
GPU集群网络拓扑:XGMI/NVLink(节点内),InfiniBand/RoCE(节点间),及其对MoE全对全模式的影响
NIC供应商生态(Mellanox ConnectX, AMD Pollara/AINIC, Broadcom Thor2)及用户态驱动程序库
使用rocprofv3、Perfetto、ibstat/perfquery分析网络工作负载性能
ROCm、hipcc或AMD GPU架构经验
AI 洞察
优缺点分析
优点
- 参与前沿的AI基础设施研发,接触最先进的GPU通信和推理优化技术
- 代码直接贡献到SGLang和vLLM等大热开源项目,获得业内高度认可
- AMD作为全球半导体巨头,提供完善的研发资源和技术支持,学习曲线陡峭
- 团队具备深厚的RDMA和GPU内核经验,是技术成长的绝佳环境
- 工作可能面临高强度的性能优化需求,需要处理复杂的分布式系统问题
- 适合对AI系统底层技术有强烈兴趣,具备扎实编程功底和较强学习能力,乐于在开源社区中钻研的工程师
缺点 / 挑战
- 技术要求极高,需要同时掌握LLM推理、RDMA网络和GPU编程,学习压力大
- 开源社区协作需要跨时区沟通,对沟通和协调能力有较高要求
角色解读
- 从IC向技术专家或团队负责人发展,主导GPU通信和AI推理基础设施的关键项目
- 成为开源社区核心贡献者,在SGLang/vLLM等项目中建立个人技术影响力
- 在AMD内部可转向系统架构师或技术管理方向,深入半导体行业的软硬件协同发展
- 负责MORI框架在SGLang和vLLM中的端到端集成,优化MoE专家并行和PD分离场景下的GPU通信效率
- 深入理解KVCache管理和分布式执行引擎,设计并实现高效的MORI-IO和MORI-SHMEM运行时
- 参与性能基准测试和分析,基于profiling数据推动推理性能的持续优化
- 通过开源PR贡献代码,与全球开发者协作,保持MORI在AI推理基础设施的领先性
- 精通C++和Python,并能编写高性能的GPU算子(如PyTorch自定义扩展)
- 熟悉至少一个主流LLM推理框架(SGLang、vLLM等)的内部机制,包括调度、内存管理和分布式执行
- 了解分布式系统、RDMA通信和GPU架构(尤其是AMD ROCm/HIP)
- 具备开源协作经验,能进行代码审查和跨团队沟通
申请策略
- 在求职信中说明你对AI推理基础设施的热情,并提及你在相关开源项目的参与经历
- 关注AMD在AI领域的战略动向,在面试中表现出对业务的深入理解
- 突出你在LLM推理框架(如vLLM、SGLang)中的实际工作和贡献,包括PR、性能优化案例
- 强调C++/Python编程能力,特别是涉及GPU编程(CUDA/HIP/Rocm)或高性能计算的项目
- 展示你对分布式系统、网络通信(RDMA、NCCL)的理解和实践经验
- 如有开源项目维护经验,请附上相关链接和具体贡献
- 熟悉SGLang和vLLM的源码,尝试为它们贡献代码或修改
- 学习RDMA编程基础(如InfiniBand verbs),了解GPUDirect等技术
面试指南
- 用STAR法则描述项目经历,突出你的技术决策和带来的成果
- 对于系统设计问题,先阐述整体架构,再深入具体细节,同时考虑权衡取舍
- 展示你对开源社区的贡献,强调协作和代码质量
- 请详细解释你在SGLang或vLLM中做过的工作,特别是性能优化方面的案例
- 什么是MoE专家并行?你如何设计它的all-to-all通信?
- 描述一次你调试分布式系统性能问题的经历
- RDMA有哪些关键概念?如何实现GPU间的直接通信?
- 你如何看待AMD ROCm与NVIDIA CUDA的竞争?
职位点评
69
综合评分
前沿AI推理基础设施研发,技术成长空间极大,薪资和WLB待定。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术挑战和职业成长的工程师,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活50
使命价值75
薪资福利
60中等
薪资未在JD中透露,但AMD作为跨国半导体巨头,提供有竞争力的薪酬和福利,不过具体待遇需面试了解。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
90较高
该职位处于AI基础设施的最前沿,能深入学习GPU通信、推理框架和分布式系统,技能成长空间极大。
技术前沿前沿/新兴技术
技术栈RDMA、GPU、SGLang、vLLM、MoE、KVCache、ROCm、HIP、PyTorch
业务类型ambiguous
工作生活
50较低
工作地点在上海,但JD未提及弹性工作或远程,可能以办公室办公为主,WLB情况未知。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
推动AI高性能计算的发展,虽然不直接面向普通用户,但对行业有显著促进作用和战略意义。
行业发展高速增长赛道
社会影响中性/一般
使命信号accelerate next-generation computing experiences
创新程度开拓性创新(行业首创)
超威半导体 的其他在招职位
AI Software Engineer — High-Performance GPU Communication
超威半导体 · 上海市AI 估算 · 35k-55kAI Framework Engineer
超威半导体 · 上海市AI 估算 · 35k-60kSys/Test Validation Engineer
超威半导体 · 上海市AI 估算 · 30k-50kDatacenter Server Solution Architect
超威半导体 · 深圳市AI 估算 · 25k-45kComponent Sales Account Manager
超威半导体 · 北京市AI 估算 · 45k-75k
相似职位推荐
Watch Jobs