
阿里巴巴
智能引擎-KV Cache 存储系统开发-杭州
智能引擎-KV Cache 存储系统开发-杭州
发布于 大约 14 小时前普通员工/个人贡献者
杭州市
中级经验
全职员工
仅现场办公
学历未注明
后端开发
Cuda
Gpu显存管理
Kvcache
Pagedattention
Sglang
Tensorrt-Llm
Vllm
分布式系统
AI 估算 · 30k–50k
阿里核心AI基础设施岗位,技术要求高,市场稀缺,杭州互联网薪资较高,综合估算月薪3-5万。
职位详情
关于这个职位
该职位聚焦于LLM推理中的KV Cache存储系统研发,负责设计优化内存管理与缓存复用机制,实现多级存储的卸载与加载,并针对vLLM等主流推理框架进行深度性能优化
你将接触最前沿的AI基础设施技术,解决长上下文场景下的显存瓶颈,是高技术含量与高挑战性的核心岗位
最低要求
扎实的系统编程能力,精通 C++/Python,熟悉高性能并发编程与内存管理
深入理解 KVCache 相关技术,PagedAttention / vAttention 等显存分页管理,Prefix Cache / Semantic Cache 等缓存复用技术,KVCache 量化(INT8/FP8 KV)压缩技术,KVCache Offload 至 CPU/SSD 的分层存储技术
理解 LLM 推理原理,熟悉 Transformer 架构及 Attention 计算机制,熟悉主流 LLM 推理框架
熟悉 CUDA 编程,了解 GPU 显存管理、PCIe/NVLink 传输机制
工作职责
KVCache 核心系统研发,负责 LLM 推理场景下 KVCache 的架构设计与工程实现,优化 KVCache 的内存管理、显存分配与生命周期调度策略,研究并实现 Prefix Cache、Radix Tree Cache 等高效缓存复用机制,提升 Cache Hit Rate
设计跨机、跨节点的分布式 KVCache 共享与迁移方案,实现 KVCache 在 GPU HBM / CPU DRAM / NVMe SSD 多级存储间的高效卸载(Offload)与加载,针对长上下文、多轮对话场景优化 KVCache 的存储与传输效率
推理性能优化,结合 Continuous Batching、PagedAttention、Chunked Prefill 等机制,协同优化 KVCache 调度策略,分析推理链路中 KVCache 相关的性能瓶颈,进行端到端性能优化,针对主流推理框架(vLLM / SGLang / TensorRT-LLM / RTP-LLM)进行 KVCache 模块的深度优化与定制
系统可靠性与可观测性建设,建设 KVCache 命中率、内存占用、调度延迟等核心指标的监控体系,保障大规模集群下 KVCache 服务的高可用与容错能力
优先资格
加分项:有在 vLLM / SGLang / Mooncake 等开源项目贡献 KVCache 相关 PR 的经验,熟悉存储系统(Ceph / 3FS)或分布式缓存系统(Redis / Memcached)设计原理
AI 洞察
优缺点分析
优点
- 属于前沿AI基础设施方向,技术壁垒高,成长空间极大
- 阿里平台资源丰富,团队技术实力强,有机会与顶级工程师合作
- 薪资竞争力强,股票激励等福利优厚,职业品牌增值明显
- 深度接触开源生态与工业级系统,个人技术影响力易辐射
- 技术深度与广度要求高,需同时掌握系统、GPU、分布式多方面知识
- 该方向变化速度快,需持续学习新技术,保持竞争状态
- 适合热爱底层系统优化、对AI推理性能有浓厚兴趣,且能接受高强度工作节奏的资深工程师
缺点 / 挑战
- 业务压力大,阿里高强度工作文化,可能面临较大加班压力
角色解读
- 在AI基础设施领域深耕,成为KV Cache/推理加速方向的资深技术专家
- 横向拓展至整个LLM推理系统架构,晋升为分布式系统架构师或技术负责人
- 有机会在开源社区(如vLLM)建立影响力,向技术社区领袖发展
- 负责LLM推理中KV Cache的架构设计与实现,优化内存/显存调度策略,提升缓存命中率
- 设计分布式KV Cache共享与多级存储卸载方案,解决长上下文场景的存储与传输瓶颈
- 针对vLLM等主流推理框架进行性能优化,结合PagedAttention等机制做端到端调优
- 建设KV Cache监控与容错体系,保障大规模集群下的高可用性
- 精通C++/Python,具备扎实的系统编程与并发/内存管理能力
- 深入理解KVCache技术栈,如PagedAttention、Prefix Cache、量化压缩等
- 熟悉Transformer架构与LLM推理原理,了解主流推理框架
- 熟悉CUDA编程与GPU显存管理,掌握PCIe/NVLink数据传输机制
申请策略
- 提前准备针对KVCache的深度技术方案,展示解决复杂问题的思路
- 在简历中量化成果,如将缓存命中率提升X%、推理延迟降低Y%,增加说服力
- 突出系统级性能优化经验,如内存管理、缓存设计、高并发编程的量化成果
- 展示LLM相关项目经历,尤其是KVCache、PagedAttention等实际应用案例
- 强调对vLLM/SGLang等开源框架的源码理解或PR贡献,体现技术深度
- 标注CUDA编程经验与GPU优化实践,如kernel优化、显存利用率提升
- 深度学习vLLM源码中的KVCache实现,尝试手写一个简单版本理解机制
- 补充CUDA编程与GPU内存层次知识,动手写一些基于并行计算的优化程序
面试指南
- 采用'场景-方案-权衡'结构:先说明问题背景,再提出技术方案,分析优缺点与适用场景
- 结合具体数据与案例,突出量化结果和工程细节,避免空泛理论
- 展示系统思维,从GPU硬件特性、推理框架、业务场景多维度综合分析
- 请解释PagedAttention的原理,并说明它如何提升显存利用率?
- 你会如何设计KV Cache的缓存替换策略以提高命中率?
- 描述一次你优化高性能系统性能的经历,遇到了哪些挑战?
- 如何在不同存储层级(HBM/DRAM/SSD)间选择数据放置?
- 你对vLLM了解多少?如果让你改进其KVCache模块,你会怎么做?
职位点评
72
综合评分
阿里AI基础设施核心岗位,前沿技术高成长,薪资优厚,但工作强度大WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术深度、快速成长且能接受高强度工作节奏的资深工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活45
使命价值70
薪资福利
75中等
阿里平台与薪资竞争力强,但JD未披露具体薪资福利,符合大厂标准水平。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
核心AI基础设施方向,技术前沿,成长机会多,但未明确晋升路径。
技术前沿前沿/新兴技术
技术栈KVCache、PagedAttention、vLLM、CUDA、GPU、分布式系统
业务类型ambiguous
工作生活
45较低
仅现场办公,未提及弹性工作或WLB,阿里工作强度普遍较高,生活平衡挑战大。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI基础设施推动行业进步,技术影响力大,但JD未明确社会价值导向。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs