YMTC logo
长江存储
CUDA专家(J14609)

CUDA专家(J14609)

发布于 大约 8 小时前

普通员工/个人贡献者

上海市 / 武汉市
中级经验
全职员工
仅现场办公
本科
云计算
Cuda
Gpu编程
Kv Cache
Linux内核
Nvme协议
Vllm
向量检索
大模型推理
存储系统

AI 估算 · 20k–45k

CUDA专家稀缺,GPU存储方向热门,结合上海武汉市场水平,预估月薪20-45k,年终约14薪。

职位详情

关于这个职位

该职位专注于GPU直访存储技术,涉及CUDA编程、NVMe协议和KV SSD,推动大模型推理中的KV Cache卸载优化

适合有深厚GPU编程和存储系统背景的工程师,负责从底层链路到性能优化的全面工作

最低要求

基本要求

计算机、电子工程、软件工程、存储系统等相关专业本科及以上学历,3年以上系统软件开发经验
CUDA与GPU编程:精通CUDA C/C++,具备3年以上GPU kernel开发经验
并发与同步:深刻理解GPU上的原子操作、内存序、自旋锁
能运用Little's Law等模型分析I/O并发度,从队列深度、在飞命令数反推系统瓶颈
存储协议:熟悉NVMe协议(1.4+):SQ/CQ队列对、Doorbell机制、PRP/SGL地址描述、中断与轮询完成模式
了解NVMe KV Command Set者优先
系统功底:具备扎实的Linux内核与驱动开发能力,能够阅读和修改内核模块(如libnvm),理解DMA、PCIe TLP、MMIO/BAR、IOMMU等底层机制
熟练使用Nsight Systems / Nsight Compute / perf等性能分析工具,具备端到端延迟拆解(submit → dispatch → DSA → completion)的问题定位能力
理解大模型推理基本概念:Transformer、Attention、KV Cache、Prefill/Decode分离、长上下文

工作职责

跟踪 GPU 直访存储(GPU-Initiated Storage)领域前沿进展,包括 BaM、SwarmIO、GIDS、GustANN、GPUDirect Storage 等开源系统与学术论文,以及 Samsung、SK Hynix、Kioxia 等厂商 KV SSD 技术演进

深入研究 GPU 发起 I/O 的完整链路:NVMe SQ/CQ 队列模型、Doorbell 批量提交、CQ 轮询与自旋等待优化、GPU 线程并发模型与队列映射策略,定位并消除端到端性能瓶颈
负责 GPU 页缓存(Page Cache)机制的分析与参数调优,包括缓存容量与命中率关系、页槽位并发约束、缓存替换开销,建立与真实业务(KV Cache 卸载、向量检索)对应的访问模型
开展多平台性能评测与交叉验证:在 RTX 6000 Pro / H200 等 GPU 平台及多 DSA 服务器上,使用 nvm-block-bench、fio 等工具对标真实企业级 SSD,输出定量性能分析报告与瓶颈定位结论
研究 GPU + SSD 协同的十亿级向量检索(GustANN / DiskANN / CAGRA),评估高 IOPS 盘在 ANNS 场景下的查询效率,推动存储侧与检索侧协同优化
推动 GPU 直访存储能力与推理栈(vLLM / SGLang / Mooncake / LMCache)对接,参与 KV Cache 分层卸载链路的架构设计与验证,推导存储产品核心需求并制定技术路线图
学习 BaM / SwarmIO / GustANN 开源代码,沉淀内部技术文档、测试报告与培训材料,支撑团队能力建设

优先资格

加分项

BaM / GIDS / cuFile 经验
SwarmIO / NVMeVirt仿真器开发经验
SSD、Flash、存储等相关经验

AI 洞察

优缺点分析

优点

  • 处于AI基础设施前沿,涉及GPU存储交叉领域,技术含量高
  • 公司是存储芯片大厂,有实际硬件背景,能深入底层系统
  • 工作内容涉及学术界和工业界,能接触多个开源项目和最新技术
  • 技术难度大,需要同时精通GPU编程和存储协议,知识面广
  • 技术更新快,需要持续学习

缺点 / 挑战

  • 多平台评测和性能调优需要大量时间投入,工作强度可能较高
  • 适合对底层性能优化有热情的资深工程师,喜欢挑战,愿意深入硬软件结合领域

角色解读

  • 晋升路径:技术专家向首席工程师或架构师方向发展,或转向存储系统研发管理
  • 跨领域发展:结合AI基础设施,成为AI存储或大规模推理系统的专家
  • 行业前景:GPU直访存储是AI基础设施的热点,随着大模型规模增长,需求持续上升
  • 研究GPU直访存储前沿技术,如BaM、SwarmIO等开源系统,并评估KV SSD等硬件演进
  • 深入分析GPU发起I/O的链路,优化NVMe队列、Doorbell提交和轮询机制,消除性能瓶颈
  • 调优GPU页缓存,为KV Cache卸载和向量检索建立访问模型,并与vLLM等推理栈对接
  • 精通CUDA C/C++和GPU kernel开发,具备3年以上经验
  • 深刻理解GPU并发模型、原子操作、内存序和自旋锁,能运用Little's Law分析并发度
  • 熟悉NVMe协议及Linux内核驱动开发,能修改内核模块,理解DMA、PCIe等底层机制
  • 了解大模型推理基本概念,如Transformer、KV Cache等

申请策略

  • 体现对GPU直访存储领域的深入理解,可在简历中阐述自己的见解
  • 关注长江存储的技术方向,了解其在AI存储方面的布局
  • 突出CUDA kernel开发经验和具体性能优化成果(如加速比、延迟降低)
  • 展示存储相关项目,如NVMe驱动、SSD固件或用户态I/O库
  • 如有开源贡献(如BaM、vLLM)务必写明
  • 强调系统级调试能力和使用Nsight/perf的经验
  • 学习NVMe协议细节和Linux内核块设备层
  • 熟悉vLLM、SGLang等推理框架的KV Cache管理

面试指南

  • 对于技术原理题,先讲概念,再结合项目经验阐述实际优化措施
  • 对于场景设计题,先明确目标和约束,再提出分步骤的解决方案,注意量化指标
  • 对于经验题,使用STAR法则,突出挑战和成果
  • 请解释GPU发起I/O的完整链路,并指出可能的性能瓶颈
  • 如何优化NVMe队列的并发度?Little's Law如何应用?
  • 你如何分析CUDA kernel的性能?举例说明
  • 了解KV Cache卸载吗?如何设计GPU和SSD协同的缓存分层?
  • 如果让你评测一个新的NVMe SSD的随机读性能,你会怎么做?

职位点评

68
综合评分

前沿GPU存储技术岗,技术挑战大,薪资有竞争力但未明示,工作地点在上海或武汉。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿和个人成长,对生活节奏要求不高的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展85
工作生活55
使命价值70

薪资福利

60中等

JD未披露薪资与福利,但岗位技术门槛高,市场竞争力强,预期薪资水平较好。

薪资信号未披露(AI估算:20K-45K/月)

成长发展

85较高

该岗位涉及GPU直访存储等前沿技术,技术挑战大,成长空间广阔,但未明确提及晋升路径。

技术前沿前沿/新兴技术
技术栈CUDA、GPU、NVMe、vLLM、KV Cache、BaM、SwarmIO
业务类型ambiguous

工作生活

55较低

JD未说明工作模式与加班情况,办公地点为上海或武汉,具体位置未知,生活方式信号不足。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

存储芯片行业受AI需求推动,属于高速增长赛道;但岗位直接社会效益不显著,创新性较强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs