
长江存储
AI中间件开发专家工程师(SSD方向)(J14613)
AI中间件开发专家工程师(SSD方向)(J14613)
发布于 大约 8 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
本科
后端开发
Cuda
Io_Uring
Kv Cache
Llama.Cpp
Moe
Sglang
Spdk
Vllm
AI 估算 · 30k–50k
大模型推理优化为稀缺技能,上海市场溢价高,但存储行业薪资偏稳健。
职位详情
关于这个职位
该职位负责大模型推理加速中间件的研发,核心工作是优化KV Cache在显存、内存、SSD之间的智能调度,以及MoE模型专家的动态加载与卸载,以突破单卡显存瓶颈,提升推理吞吐量
你将接触vLLM、SGLang等主流推理引擎,并深入存储I/O优化(如io_uring、零拷贝),适合对AI底层系统开发充满热情的资深工程师
最低要求
本科及以上学历,电子信息,计算机等相关专业 (985/211优先),5年以上C/C++/Python开发经验
有vLLM、SGLang或LlamaCpp任一推理框架的二次开发经验
了解Transformer架构及KV Cache基本原理,MoE等模型架构和推理框架原理
熟悉Git、CMake、Docker等工程化工具
有一定的存储驱动的开发经验和相关存储host的调试能力
工作职责
负责KV Cache分层存储模块的设计与开发,实现显存、内存、SSD间的动态换入换出与淘汰策略
负责MoE模型专家的调度管理,实现非活跃专家的按需加载与卸载
负责主流推理引擎(llama.cpp/vLLM/SGLang等)的中间件对接与集成适配
负责存储I/O性能优化(io_uring/零拷贝等),提升KV Cache读写效率
负责多硬件多操作系统适配和兼容性,包括iGPU,dGPU,Linux和windows操作系统
持续对标行业方案,完成性能测试与迭代调优
优先资格
有CUDA编程或GPU显存优化经验
了解MoE架构或有相关开发经验
有存储系统Host方向(SPDK)性能调优经验
熟悉CUDA统一内存(Unified Memory)编程,或者iGPU/dGPU平台推理调优经验
AI 洞察
优缺点分析
优点
- 大模型推理加速是当前热点,技术含金量高,能积累底层优化稀缺经验
- 长江存储作为存储大厂,可结合SSD硬件特性,实现软硬协同优化
- 岗位方向专注,竞争者相对较少,价值感凸显
- 技术栈跨度大,需同时掌握AI框架和存储系统,学习曲线陡峭
- 大模型迭代快,需要持续跟进新架构和推理引擎更新
缺点 / 挑战
- 性能调优工作可能面临高强度开发压力,需具备抗压能力
- 适合有扎实C++功底,对AI推理和存储技术有强烈兴趣,乐于挑战底层性能极限的工程师
角色解读
- 可发展为AI基础设施系统架构师,主导大模型推理优化方向
- 深入底层技术后,可横向扩展至GPU计算、存储系统等领域
- 大模型加速持续火热,该方向人才稀缺,职业护城河深
- 负责KV Cache在显存、内存、SSD间的分层存储调度,设计动态换入换出与淘汰策略
- 实现MoE模型专家的按需加载与卸载,优化非活跃专家的资源管理
- 对接并集成主流推理引擎(llama.cpp/vLLM/SGLang),进行中间件适配
- 通过io_uring、零拷贝等技术优化存储I/O性能,并支持多硬件多操作系统
- 精通C/C++/Python,具备5年以上系统开发经验
- 熟悉vLLM、SGLang或LlamaCpp任一推理框架的二次开发
- 深入理解Transformer、KV Cache、MoE架构及推理原理
- 掌握Git、CMake、Docker等工程化工具,具备存储驱动或SPDK调优经验更佳
申请策略
- 了解长江存储的业务及在AI存储方向的布局,结合SSD在AI场景的机遇进行沟通
- 准备一个完整的性能调优案例,用数据证明你的能力
- 突出vLLM/SGLang/llama.cpp的二次开发经验,附上具体优化点和成果
- 展示C/C++高性能编程能力,例如io_uring、零拷贝、SPDK等存储优化项目经历
- 体现对KV Cache、MoE架构的深入理解,可给出架构解析或调优案例
- 如有CUDA或GPU显存优化经验,务必加粗展示
- 提前阅读vLLM的PagedAttention和SGLang的RadixAttention源码,理解调度机制
- 学习CUDA统一内存(Unified Memory)和iGPU/dGPU平台推理调优技术
面试指南
- 采用“背景-思路-实现-效果”结构,突出量化结果和性能提升
- 从系统设计角度出发,考虑缓存策略、并发安全、一致性等
- 结合底层硬件原理,展示软硬件协同优化思维
- 请详细解释KV Cache的工作原理,以及如何设计显存、内存、SSD的换入换出策略?
- 你在使用vLLM或SGLang时做过哪些二次开发?具体解决了什么问题?
- MoE模型的专家调度有哪些难点?如何实现按需加载与卸载?
- 如何调试io_uring性能瓶颈?零拷贝技术在KV Cache场景下的应用如何实现?
- 如果单卡显存不足以运行大模型,你会给出哪些优化方案?
职位点评
68
综合评分
前沿AI中间件研发,技术含金量高,成长性强,但薪资福利未明,工作强度待评估。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度、渴望在大模型底层优化领域深耕的工程师,能接受现场办公和可能的研发强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展88
工作生活50
使命价值75
薪资福利
60中等
JD未披露具体薪资与福利,但岗位层级高且技术稀缺,市场价值预计较高。奖金和福利信息不明,需在面试中确认。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
88较高
大模型推理加速是前沿技术方向,岗位涉及KV Cache、MoE、高性能存储等深度技术,成长空间极大。
技术前沿前沿/新兴技术
技术栈KV Cache、MoE、vLLM、SGLang、llama.cpp、io_uring、CUDA、SPDK、C++、Python
业务类型ambiguous
工作生活
50较低
JD未提及远程或弹性工作安排,工作地点为上海,属于现场办公,推测可能面临研发强度压力,WLB不确定。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
AI基础设施是高速增长赛道,该职位直接推动大模型高效落地,技术价值和社会价值较好。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
长江存储 的其他在招职位
相似职位推荐
Watch Jobs