YMTC logo
长江存储
AI中间件开发专家工程师(SSD方向)(J14613)

AI中间件开发专家工程师(SSD方向)(J14613)

发布于 大约 8 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
本科
后端开发
Cuda
Io_Uring
Kv Cache
Llama.Cpp
Moe
Sglang
Spdk
Vllm

AI 估算 · 30k–50k

大模型推理优化为稀缺技能,上海市场溢价高,但存储行业薪资偏稳健。

职位详情

关于这个职位

该职位负责大模型推理加速中间件的研发,核心工作是优化KV Cache在显存、内存、SSD之间的智能调度,以及MoE模型专家的动态加载与卸载,以突破单卡显存瓶颈,提升推理吞吐量

你将接触vLLM、SGLang等主流推理引擎,并深入存储I/O优化(如io_uring、零拷贝),适合对AI底层系统开发充满热情的资深工程师

最低要求

本科及以上学历,电子信息,计算机等相关专业 (985/211优先),5年以上C/C++/Python开发经验

有vLLM、SGLang或LlamaCpp任一推理框架的二次开发经验
了解Transformer架构及KV Cache基本原理,MoE等模型架构和推理框架原理
熟悉Git、CMake、Docker等工程化工具
有一定的存储驱动的开发经验和相关存储host的调试能力

工作职责

负责KV Cache分层存储模块的设计与开发,实现显存、内存、SSD间的动态换入换出与淘汰策略

负责MoE模型专家的调度管理,实现非活跃专家的按需加载与卸载
负责主流推理引擎(llama.cpp/vLLM/SGLang等)的中间件对接与集成适配
负责存储I/O性能优化(io_uring/零拷贝等),提升KV Cache读写效率
负责多硬件多操作系统适配和兼容性,包括iGPU,dGPU,Linux和windows操作系统
持续对标行业方案,完成性能测试与迭代调优

优先资格

有CUDA编程或GPU显存优化经验

了解MoE架构或有相关开发经验
有存储系统Host方向(SPDK)性能调优经验
熟悉CUDA统一内存(Unified Memory)编程,或者iGPU/dGPU平台推理调优经验

AI 洞察

优缺点分析

优点

  • 大模型推理加速是当前热点,技术含金量高,能积累底层优化稀缺经验
  • 长江存储作为存储大厂,可结合SSD硬件特性,实现软硬协同优化
  • 岗位方向专注,竞争者相对较少,价值感凸显
  • 技术栈跨度大,需同时掌握AI框架和存储系统,学习曲线陡峭
  • 大模型迭代快,需要持续跟进新架构和推理引擎更新

缺点 / 挑战

  • 性能调优工作可能面临高强度开发压力,需具备抗压能力
  • 适合有扎实C++功底,对AI推理和存储技术有强烈兴趣,乐于挑战底层性能极限的工程师

角色解读

  • 可发展为AI基础设施系统架构师,主导大模型推理优化方向
  • 深入底层技术后,可横向扩展至GPU计算、存储系统等领域
  • 大模型加速持续火热,该方向人才稀缺,职业护城河深
  • 负责KV Cache在显存、内存、SSD间的分层存储调度,设计动态换入换出与淘汰策略
  • 实现MoE模型专家的按需加载与卸载,优化非活跃专家的资源管理
  • 对接并集成主流推理引擎(llama.cpp/vLLM/SGLang),进行中间件适配
  • 通过io_uring、零拷贝等技术优化存储I/O性能,并支持多硬件多操作系统
  • 精通C/C++/Python,具备5年以上系统开发经验
  • 熟悉vLLM、SGLang或LlamaCpp任一推理框架的二次开发
  • 深入理解Transformer、KV Cache、MoE架构及推理原理
  • 掌握Git、CMake、Docker等工程化工具,具备存储驱动或SPDK调优经验更佳

申请策略

  • 了解长江存储的业务及在AI存储方向的布局,结合SSD在AI场景的机遇进行沟通
  • 准备一个完整的性能调优案例,用数据证明你的能力
  • 突出vLLM/SGLang/llama.cpp的二次开发经验,附上具体优化点和成果
  • 展示C/C++高性能编程能力,例如io_uring、零拷贝、SPDK等存储优化项目经历
  • 体现对KV Cache、MoE架构的深入理解,可给出架构解析或调优案例
  • 如有CUDA或GPU显存优化经验,务必加粗展示
  • 提前阅读vLLM的PagedAttention和SGLang的RadixAttention源码,理解调度机制
  • 学习CUDA统一内存(Unified Memory)和iGPU/dGPU平台推理调优技术

面试指南

  • 采用“背景-思路-实现-效果”结构,突出量化结果和性能提升
  • 从系统设计角度出发,考虑缓存策略、并发安全、一致性等
  • 结合底层硬件原理,展示软硬件协同优化思维
  • 请详细解释KV Cache的工作原理,以及如何设计显存、内存、SSD的换入换出策略?
  • 你在使用vLLM或SGLang时做过哪些二次开发?具体解决了什么问题?
  • MoE模型的专家调度有哪些难点?如何实现按需加载与卸载?
  • 如何调试io_uring性能瓶颈?零拷贝技术在KV Cache场景下的应用如何实现?
  • 如果单卡显存不足以运行大模型,你会给出哪些优化方案?

职位点评

68
综合评分

前沿AI中间件研发,技术含金量高,成长性强,但薪资福利未明,工作强度待评估。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度、渴望在大模型底层优化领域深耕的工程师,能接受现场办公和可能的研发强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展88
工作生活50
使命价值75

薪资福利

60中等

JD未披露具体薪资与福利,但岗位层级高且技术稀缺,市场价值预计较高。奖金和福利信息不明,需在面试中确认。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

88较高

大模型推理加速是前沿技术方向,岗位涉及KV Cache、MoE、高性能存储等深度技术,成长空间极大。

技术前沿前沿/新兴技术
技术栈KV Cache、MoE、vLLM、SGLang、llama.cpp、io_uring、CUDA、SPDK、C++、Python
业务类型ambiguous

工作生活

50较低

JD未提及远程或弹性工作安排,工作地点为上海,属于现场办公,推测可能面临研发强度压力,WLB不确定。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

AI基础设施是高速增长赛道,该职位直接推动大模型高效落地,技术价值和社会价值较好。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs