YMTC logo
长江存储
AI Storage 研究员/专家(SSD)(J14570)

AI Storage 研究员/专家(SSD)(J14570)

发布于 大约 15 小时前

普通员工/个人贡献者

上海市 / 武汉市
高级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Cuda
Ebpf
Nvme
Rdma
Spdk
Ssd
Vllm
Gpudirect Storage

AI 估算 · 30k–50k

AI存储方向专家级岗位,技术壁垒高,市场需求大,预计薪资位于行业高端水平。

职位详情

关于这个职位

该职位专注于AI存储领域,主导基于SSD的KV Cache卸载与存储调度,通过算法-系统协同优化降低大模型推理延迟、提升吞吐量

你将深入底层,对NVMe协议、NAND特性及GPU直连存储进行深度调优,平衡性能、成本与可靠性
适合具备丰富存储系统开发经验、精通NVMe和CUDA并熟悉大模型推理原理的技术专家

最低要求

计算机、电子工程或相关专业硕士及以上学历,5 年以上存储系统开发经验,其中至少 2 年专注于高性能 NVMe SSD 或 AI 基础设施领域

精通 NVMe 协议 规范,熟悉 Linux 内核存储子系统(Block Layer, Filesystem, io_uring)
熟练掌握 GPUDirect Storage (GDS)、RDMA、CUDA 编程模型,具备 GPU 直连存储的实际开发经验
精通 C/C++ 或 Rust,具备高性能并发系统开发能力,熟悉 SPDK 者优先
深入理解 Transformer 架构及大模型推理原理,熟悉 PagedAttention、Speculative Decoding 等主流推理优化算法的内存/显存访问模式
具备从存储系统角度对推理算法进行协同优化的能力,能够根据算法的 I/O 特征(如 Prefill 与 Decode 阶段的差异)设计高效的调度策略
熟悉 vLLM、DeepSpeed、PyTorch 等框架的 I/O 机制及显存管理逻辑,有相关源码阅读或修改经验者优先
具备极强的性能分析与调优能力,熟练使用 Perf, eBPF, Nsight Systems 等工具定位系统瓶颈(如 I/O 抖动、延迟毛刺、PCIe 带宽利用率等)

工作职责

主导基于 SSD 的 KV Cache 卸载与存储调度,通过算法 - 系统协同优化显著降低推理延迟并提升吞吐量

基于 NVMe 协议及 NAND 特性进行底层深度调优,以平衡性能、成本与可靠性

优先资格

有 ZNS SSD或 Computational Storage (CSD) 项目实际落地经验

在顶级会议发表过相关论文,或是 vLLM 等知名开源项目的核心贡献者
深入理解 NAND Flash 物理特性及 FTL (Flash Translation Layer) 算法原理

AI 洞察

优缺点分析

优点

  • 技术前沿性极强,直接参与AI基础设施核心环节,紧跟大模型热潮
  • 长江存储是国内存储龙头,平台资源丰富,有机会参与行业标准制定
  • 对技能广度要求高,需同时精通存储系统、GPU编程和AI推理算法
  • 技术更新快,需要持续学习前沿论文和开源项目,保持竞争力
  • 适合拥有丰富存储系统开发经验、热爱底层技术、对大模型推理有浓厚兴趣且善于跨领域协同优化的技术专家

缺点 / 挑战

  • 工作内容具有深度和挑战性,能积累底层存储与AI系统协同优化的稀缺经验
  • 工作强度可能较大,涉及底层性能调优和系统瓶颈排查,需要极强的耐心和问题解决能力

角色解读

  • 成为AI存储领域的顶级专家,主导核心技术演进
  • 横向拓展至计算存储(CSD)、ZNS SSD等前沿方向,引领行业标准
  • 向架构师或技术总监发展,负责整体AI基础设施的存储方案设计
  • 主导SSD基于KV Cache的卸载与调度,优化大模型推理性能
  • 深入NVMe协议和NAND特性进行底层调优,平衡性能、成本与可靠性
  • 使用GPUDirect Storage、RDMA等技术实现GPU直连存储,减少数据搬运延迟
  • 协同推理算法与存储系统,设计针对Prefill/Decode阶段的I/O调度策略
  • 精通NVMe协议、Linux内核存储子系统和io_uring
  • 熟练使用GPUDirect Storage、RDMA、CUDA进行GPU直连存储开发
  • 掌握C/C++或Rust,具备高性能并发系统开发能力,熟悉SPDK
  • 深入理解Transformer及大模型推理原理(PagedAttention等),熟悉vLLM/DeepSpeed框架的I/O机制

申请策略

  • 了解长江存储在AI存储方向的战略布局,在面试中表达对技术路线的见解
  • 准备好一个完整的项目案例,从问题定义到方案设计、实施优化和最终收益
  • 突出NVMe、GDS、RDMA等存储相关项目经验,特别是与GPU直连或AI推理相关的优化案例
  • 强调对vLLM、DeepSpeed等框架源码的修改或性能分析经历
  • 展示性能调优成果,如使用Perf/eBPF定位并解决I/O抖动的具体实例
  • 如有开源贡献或顶级论文,务必显著标注
  • 深入学习SPDK和io_uring,掌握用户态存储栈的开发
  • 熟悉PagedAttention、Speculative Decoding等推理优化算法的内存访问模式

面试指南

  • 技术原理类问题:先阐述基本原理,再结合实际项目经验说明应用场景和优化效果
  • 系统设计类问题:从需求分析入手,提出多种方案并对比优劣,最后给出推荐方案及理由
  • 问题排查类问题:按照“现象-假设-验证-结论”的流程,展示系统性思维和使用工具的方法
  • 请详细解释NVMe协议中的SQ/CQ机制,以及如何通过SPDK提升I/O性能
  • 在大模型推理中,KV Cache卸载到SSD的常见挑战有哪些?如何通过算法-系统协同优化?
  • 描述一次使用eBPF或Perf定位存储性能瓶颈的经历,具体是怎么分析和解决的?
  • GPUDirect Storage相比传统CPU拷贝的优势是什么?实现中需要关注哪些关键技术点?
  • 请比较PagedAttention和vLLM中显存管理策略的异同,并讨论其对存储I/O的影响

职位点评

71
综合评分

AI存储前沿技术岗,高成长性,薪资未明但预期优厚,需现场办公且可能有较高工作强度。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术前沿和个人成长,对工作强度有心理准备,不太在意工作地点灵活性的资深存储专家。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值80

薪资福利

70中等

薪资未在JD中明确,但高级专家岗位通常具有竞争力,且长江存储为行业龙头,福利体系完善。但未提及具体福利,给予中等偏上评分。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

岗位涉及最前沿的AI存储技术,如KV Cache卸载、GPUDirect Storage等,技术成长空间极大。且公司平台能提供与顶级开源社区互动的机会。

技术前沿前沿/新兴技术
技术栈NVMe、GPUDirect Storage、RDMA、CUDA、SPDK、vLLM、PagedAttention
业务类型profit_center

工作生活

40较低

JD未提及远程或弹性工作,且要求现场办公。工作强度可能较大,但未明确加班情况。上海/武汉的工作地点属于科技园区域,通勤时间可能较长。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

AI基础设施是当前高速增长赛道,该岗位直接贡献于大模型推理效率提升,具有显著的技术影响力。然而社会影响中性,不直接面对终端用户。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs