Alibaba logo
阿里巴巴
智能引擎-KV Cache 存储系统开发-杭州

智能引擎-KV Cache 存储系统开发-杭州

发布于 大约 14 小时前

普通员工/个人贡献者

杭州市
中级经验
全职员工
仅现场办公
学历未注明
后端开发
Cuda
Gpu显存管理
Kvcache
Pagedattention
Sglang
Tensorrt-Llm
Vllm
分布式系统

AI 估算 · 30k–50k

阿里核心AI基础设施岗位,技术要求高,市场稀缺,杭州互联网薪资较高,综合估算月薪3-5万。

职位详情

关于这个职位

该职位聚焦于LLM推理中的KV Cache存储系统研发,负责设计优化内存管理与缓存复用机制,实现多级存储的卸载与加载,并针对vLLM等主流推理框架进行深度性能优化

你将接触最前沿的AI基础设施技术,解决长上下文场景下的显存瓶颈,是高技术含量与高挑战性的核心岗位

最低要求

扎实的系统编程能力,精通 C++/Python,熟悉高性能并发编程与内存管理

深入理解 KVCache 相关技术,PagedAttention / vAttention 等显存分页管理,Prefix Cache / Semantic Cache 等缓存复用技术,KVCache 量化(INT8/FP8 KV)压缩技术,KVCache Offload 至 CPU/SSD 的分层存储技术
理解 LLM 推理原理,熟悉 Transformer 架构及 Attention 计算机制,熟悉主流 LLM 推理框架
熟悉 CUDA 编程,了解 GPU 显存管理、PCIe/NVLink 传输机制

工作职责

KVCache 核心系统研发,负责 LLM 推理场景下 KVCache 的架构设计与工程实现,优化 KVCache 的内存管理、显存分配与生命周期调度策略,研究并实现 Prefix Cache、Radix Tree Cache 等高效缓存复用机制,提升 Cache Hit Rate

设计跨机、跨节点的分布式 KVCache 共享与迁移方案,实现 KVCache 在 GPU HBM / CPU DRAM / NVMe SSD 多级存储间的高效卸载(Offload)与加载,针对长上下文、多轮对话场景优化 KVCache 的存储与传输效率
推理性能优化,结合 Continuous Batching、PagedAttention、Chunked Prefill 等机制,协同优化 KVCache 调度策略,分析推理链路中 KVCache 相关的性能瓶颈,进行端到端性能优化,针对主流推理框架(vLLM / SGLang / TensorRT-LLM / RTP-LLM)进行 KVCache 模块的深度优化与定制
系统可靠性与可观测性建设,建设 KVCache 命中率、内存占用、调度延迟等核心指标的监控体系,保障大规模集群下 KVCache 服务的高可用与容错能力

优先资格

加分项:有在 vLLM / SGLang / Mooncake 等开源项目贡献 KVCache 相关 PR 的经验,熟悉存储系统(Ceph / 3FS)或分布式缓存系统(Redis / Memcached)设计原理

AI 洞察

优缺点分析

优点

  • 属于前沿AI基础设施方向,技术壁垒高,成长空间极大
  • 阿里平台资源丰富,团队技术实力强,有机会与顶级工程师合作
  • 薪资竞争力强,股票激励等福利优厚,职业品牌增值明显
  • 深度接触开源生态与工业级系统,个人技术影响力易辐射
  • 技术深度与广度要求高,需同时掌握系统、GPU、分布式多方面知识
  • 该方向变化速度快,需持续学习新技术,保持竞争状态
  • 适合热爱底层系统优化、对AI推理性能有浓厚兴趣,且能接受高强度工作节奏的资深工程师

缺点 / 挑战

  • 业务压力大,阿里高强度工作文化,可能面临较大加班压力

角色解读

  • 在AI基础设施领域深耕,成为KV Cache/推理加速方向的资深技术专家
  • 横向拓展至整个LLM推理系统架构,晋升为分布式系统架构师或技术负责人
  • 有机会在开源社区(如vLLM)建立影响力,向技术社区领袖发展
  • 负责LLM推理中KV Cache的架构设计与实现,优化内存/显存调度策略,提升缓存命中率
  • 设计分布式KV Cache共享与多级存储卸载方案,解决长上下文场景的存储与传输瓶颈
  • 针对vLLM等主流推理框架进行性能优化,结合PagedAttention等机制做端到端调优
  • 建设KV Cache监控与容错体系,保障大规模集群下的高可用性
  • 精通C++/Python,具备扎实的系统编程与并发/内存管理能力
  • 深入理解KVCache技术栈,如PagedAttention、Prefix Cache、量化压缩等
  • 熟悉Transformer架构与LLM推理原理,了解主流推理框架
  • 熟悉CUDA编程与GPU显存管理,掌握PCIe/NVLink数据传输机制

申请策略

  • 提前准备针对KVCache的深度技术方案,展示解决复杂问题的思路
  • 在简历中量化成果,如将缓存命中率提升X%、推理延迟降低Y%,增加说服力
  • 突出系统级性能优化经验,如内存管理、缓存设计、高并发编程的量化成果
  • 展示LLM相关项目经历,尤其是KVCache、PagedAttention等实际应用案例
  • 强调对vLLM/SGLang等开源框架的源码理解或PR贡献,体现技术深度
  • 标注CUDA编程经验与GPU优化实践,如kernel优化、显存利用率提升
  • 深度学习vLLM源码中的KVCache实现,尝试手写一个简单版本理解机制
  • 补充CUDA编程与GPU内存层次知识,动手写一些基于并行计算的优化程序

面试指南

  • 采用'场景-方案-权衡'结构:先说明问题背景,再提出技术方案,分析优缺点与适用场景
  • 结合具体数据与案例,突出量化结果和工程细节,避免空泛理论
  • 展示系统思维,从GPU硬件特性、推理框架、业务场景多维度综合分析
  • 请解释PagedAttention的原理,并说明它如何提升显存利用率?
  • 你会如何设计KV Cache的缓存替换策略以提高命中率?
  • 描述一次你优化高性能系统性能的经历,遇到了哪些挑战?
  • 如何在不同存储层级(HBM/DRAM/SSD)间选择数据放置?
  • 你对vLLM了解多少?如果让你改进其KVCache模块,你会怎么做?

职位点评

72
综合评分

阿里AI基础设施核心岗位,前沿技术高成长,薪资优厚,但工作强度大WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术深度、快速成长且能接受高强度工作节奏的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活45
使命价值70

薪资福利

75中等

阿里平台与薪资竞争力强,但JD未披露具体薪资福利,符合大厂标准水平。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

核心AI基础设施方向,技术前沿,成长机会多,但未明确晋升路径。

技术前沿前沿/新兴技术
技术栈KVCache、PagedAttention、vLLM、CUDA、GPU、分布式系统
业务类型ambiguous

工作生活

45较低

仅现场办公,未提及弹性工作或WLB,阿里工作强度普遍较高,生活平衡挑战大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI基础设施推动行业进步,技术影响力大,但JD未明确社会价值导向。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs