
长江存储
CUDA专家(J14609)
CUDA专家(J14609)
发布于 大约 8 小时前普通员工/个人贡献者
上海市 / 武汉市
中级经验
全职员工
仅现场办公
本科
云计算
Cuda
Gpu编程
Kv Cache
Linux内核
Nvme协议
Vllm
向量检索
大模型推理
存储系统
AI 估算 · 20k–45k
CUDA专家稀缺,GPU存储方向热门,结合上海武汉市场水平,预估月薪20-45k,年终约14薪。
职位详情
关于这个职位
该职位专注于GPU直访存储技术,涉及CUDA编程、NVMe协议和KV SSD,推动大模型推理中的KV Cache卸载优化
适合有深厚GPU编程和存储系统背景的工程师,负责从底层链路到性能优化的全面工作
最低要求
基本要求
计算机、电子工程、软件工程、存储系统等相关专业本科及以上学历,3年以上系统软件开发经验
CUDA与GPU编程:精通CUDA C/C++,具备3年以上GPU kernel开发经验
并发与同步:深刻理解GPU上的原子操作、内存序、自旋锁
能运用Little's Law等模型分析I/O并发度,从队列深度、在飞命令数反推系统瓶颈
存储协议:熟悉NVMe协议(1.4+):SQ/CQ队列对、Doorbell机制、PRP/SGL地址描述、中断与轮询完成模式
了解NVMe KV Command Set者优先
系统功底:具备扎实的Linux内核与驱动开发能力,能够阅读和修改内核模块(如libnvm),理解DMA、PCIe TLP、MMIO/BAR、IOMMU等底层机制
熟练使用Nsight Systems / Nsight Compute / perf等性能分析工具,具备端到端延迟拆解(submit → dispatch → DSA → completion)的问题定位能力
理解大模型推理基本概念:Transformer、Attention、KV Cache、Prefill/Decode分离、长上下文
工作职责
跟踪 GPU 直访存储(GPU-Initiated Storage)领域前沿进展,包括 BaM、SwarmIO、GIDS、GustANN、GPUDirect Storage 等开源系统与学术论文,以及 Samsung、SK Hynix、Kioxia 等厂商 KV SSD 技术演进
深入研究 GPU 发起 I/O 的完整链路:NVMe SQ/CQ 队列模型、Doorbell 批量提交、CQ 轮询与自旋等待优化、GPU 线程并发模型与队列映射策略,定位并消除端到端性能瓶颈
负责 GPU 页缓存(Page Cache)机制的分析与参数调优,包括缓存容量与命中率关系、页槽位并发约束、缓存替换开销,建立与真实业务(KV Cache 卸载、向量检索)对应的访问模型
开展多平台性能评测与交叉验证:在 RTX 6000 Pro / H200 等 GPU 平台及多 DSA 服务器上,使用 nvm-block-bench、fio 等工具对标真实企业级 SSD,输出定量性能分析报告与瓶颈定位结论
研究 GPU + SSD 协同的十亿级向量检索(GustANN / DiskANN / CAGRA),评估高 IOPS 盘在 ANNS 场景下的查询效率,推动存储侧与检索侧协同优化
推动 GPU 直访存储能力与推理栈(vLLM / SGLang / Mooncake / LMCache)对接,参与 KV Cache 分层卸载链路的架构设计与验证,推导存储产品核心需求并制定技术路线图
学习 BaM / SwarmIO / GustANN 开源代码,沉淀内部技术文档、测试报告与培训材料,支撑团队能力建设
优先资格
加分项
BaM / GIDS / cuFile 经验
SwarmIO / NVMeVirt仿真器开发经验
SSD、Flash、存储等相关经验
AI 洞察
优缺点分析
优点
- 处于AI基础设施前沿,涉及GPU存储交叉领域,技术含量高
- 公司是存储芯片大厂,有实际硬件背景,能深入底层系统
- 工作内容涉及学术界和工业界,能接触多个开源项目和最新技术
- 技术难度大,需要同时精通GPU编程和存储协议,知识面广
- 技术更新快,需要持续学习
缺点 / 挑战
- 多平台评测和性能调优需要大量时间投入,工作强度可能较高
- 适合对底层性能优化有热情的资深工程师,喜欢挑战,愿意深入硬软件结合领域
角色解读
- 晋升路径:技术专家向首席工程师或架构师方向发展,或转向存储系统研发管理
- 跨领域发展:结合AI基础设施,成为AI存储或大规模推理系统的专家
- 行业前景:GPU直访存储是AI基础设施的热点,随着大模型规模增长,需求持续上升
- 研究GPU直访存储前沿技术,如BaM、SwarmIO等开源系统,并评估KV SSD等硬件演进
- 深入分析GPU发起I/O的链路,优化NVMe队列、Doorbell提交和轮询机制,消除性能瓶颈
- 调优GPU页缓存,为KV Cache卸载和向量检索建立访问模型,并与vLLM等推理栈对接
- 精通CUDA C/C++和GPU kernel开发,具备3年以上经验
- 深刻理解GPU并发模型、原子操作、内存序和自旋锁,能运用Little's Law分析并发度
- 熟悉NVMe协议及Linux内核驱动开发,能修改内核模块,理解DMA、PCIe等底层机制
- 了解大模型推理基本概念,如Transformer、KV Cache等
申请策略
- 体现对GPU直访存储领域的深入理解,可在简历中阐述自己的见解
- 关注长江存储的技术方向,了解其在AI存储方面的布局
- 突出CUDA kernel开发经验和具体性能优化成果(如加速比、延迟降低)
- 展示存储相关项目,如NVMe驱动、SSD固件或用户态I/O库
- 如有开源贡献(如BaM、vLLM)务必写明
- 强调系统级调试能力和使用Nsight/perf的经验
- 学习NVMe协议细节和Linux内核块设备层
- 熟悉vLLM、SGLang等推理框架的KV Cache管理
面试指南
- 对于技术原理题,先讲概念,再结合项目经验阐述实际优化措施
- 对于场景设计题,先明确目标和约束,再提出分步骤的解决方案,注意量化指标
- 对于经验题,使用STAR法则,突出挑战和成果
- 请解释GPU发起I/O的完整链路,并指出可能的性能瓶颈
- 如何优化NVMe队列的并发度?Little's Law如何应用?
- 你如何分析CUDA kernel的性能?举例说明
- 了解KV Cache卸载吗?如何设计GPU和SSD协同的缓存分层?
- 如果让你评测一个新的NVMe SSD的随机读性能,你会怎么做?
职位点评
68
综合评分
前沿GPU存储技术岗,技术挑战大,薪资有竞争力但未明示,工作地点在上海或武汉。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿和个人成长,对生活节奏要求不高的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展85
工作生活55
使命价值70
薪资福利
60中等
JD未披露薪资与福利,但岗位技术门槛高,市场竞争力强,预期薪资水平较好。
薪资信号未披露(AI估算:20K-45K/月)
成长发展
85较高
该岗位涉及GPU直访存储等前沿技术,技术挑战大,成长空间广阔,但未明确提及晋升路径。
技术前沿前沿/新兴技术
技术栈CUDA、GPU、NVMe、vLLM、KV Cache、BaM、SwarmIO
业务类型ambiguous
工作生活
55较低
JD未说明工作模式与加班情况,办公地点为上海或武汉,具体位置未知,生活方式信号不足。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
存储芯片行业受AI需求推动,属于高速增长赛道;但岗位直接社会效益不显著,创新性较强。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
长江存储 的其他在招职位
相似职位推荐
SAP China iXp Intern - Intelligent Cloud Service Developer
思爱普 · 上海市AI 估算 · 3k-5k私有云高级工程师
维信诺 · 中国AI 估算 · 15k-25k软件产品-高级应用软件开发工程师-容器云-杭州
海康威视 · 杭州市AI 估算 · 25k-40k港澳琼桂解决方案架构师(J103970)
百度 · 深圳市AI 估算 · 25k-40kAnt International-Head of System Assurance (Soverign Cloud & Infrastructure)-Ant International
蚂蚁集团 · Hong Kong, China, SingaporeAI 估算 · 80k-150k
Watch Jobs