
蚂蚁集团
蚂蚁集团-存储系统研发专家-杭州/北京
蚂蚁集团-存储系统研发专家-杭州/北京
发布于 大约 13 小时前普通员工/个人贡献者
北京市 / 杭州市
专家级经验
全职员工
仅现场办公
学历未注明
软件工程
Kv Cache
Nccl
Pytorch
Rdma
Vllm
分布式训练
存储系统
强化学习
AI 估算 · 40k–70k
专家级AI基础设施研发,杭州/北京,蚂蚁平台,薪资竞争力强。
职位详情
关于这个职位
该职位负责蚂蚁集团下一代AI基础设施中的高性能数据缓存系统研发,聚焦强化学习场景
工作内容包括KV Cache优化、Checkpoint加速、权重同步等,要求精通C++/Python并熟悉主流训推框架
你将与顶尖团队共同探索智能上限,适合热爱底层技术的资深研发
最低要求
精通 Python/C++ 等编程语言,并有良好的代码风格
具有训推场景缓存系统设计与研发优化经验,例如 KV Cache、Checkpoint Engine 等
了解主流训推框架原理和代码实现,例如 TensorFlow/PyTorch/Megatron/Deepspeed/vLLM/Sglang 等
了解强化学习以及各主流分类场景的原理和实现
好奇心强,热爱技术
工作职责
负责建设面向训推一体的高性能数据缓存系统,服务蚂蚁内部的强化学习场景
通过存算结合持续提升和优化传统训练和推理场景的效率和稳定性,例如 KV Cache 性能优化、Checkpoint FO 加速等
同时解决强化场景特有的数据缓存和高性能传输需求,例如权重同步、Agentic RL 多轮对话场景下的 FO 加速等问题
持续探索和发现强化学习业界的前沿进展和问题,并在蚂蚁内部落地相关方案
优先资格
熟悉至少一种主流的强化框架,如 OpenRLHF/AReal/veRL/ChatLearn 等
基于存算结合在训推、强化场景有效率提升或者稳定性优化经验
熟悉 NCCL、GDR、GDS、RDMA、或有大规模训练网络通信优化经验
在计算机系统顶会 OSDI/SOSP/FAST/ATC/EuroSys 等上有文章发表经验
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台实力雄厚,业务场景丰富,可接触核心AI基础设施
- 技术前沿,聚焦强化学习和存储系统,个人成长空间巨大
- 团队氛围鼓励创新,有资源将新想法落地到实际生产环境
- 技术复杂度高,需要扎实的系统功底和持续的学习投入
- 领域竞争激烈,需不断跟踪学界与业界最新进展
- 适合对底层系统有浓厚兴趣、喜欢攻克性能难题、具备较强自驱力的资深研发工程师
缺点 / 挑战
- 高强度研发节奏可能带来较大压力,需适应快速迭代
角色解读
- 在AI基础设施领域深耕,成为存储与系统优化的行业专家
- 向技术架构师或团队技术负责人方向发展,主导核心系统设计
- 有机会在OSDI等顶会发表成果,提升学术影响力和行业话语权
- 设计并实现面向强化学习场景的高性能数据缓存系统,支撑训推一体化工作流
- 深入优化KV Cache和Checkpoint性能,提升训练与推理的效率和稳定性
- 解决强化学习中的权重同步、多轮对话数据流转等性能瓶颈,保障系统流畅运行
- 持续跟踪并落地业界前沿技术方案,推动团队技术演进
- 精通Python/C++,具备良好的工程实践和代码风格
- 熟悉训练推理框架(如PyTorch/vLLM)及缓存系统设计原理
- 理解强化学习基本流程和不同场景下对存储传输的需求
- 具备分布式通信(如NCCL/RDMA)经验者更有竞争力
申请策略
- 在申请材料中表达对ASystem技术方向的思考,展示与团队愿景的契合度
- 可提前准备一个针对现有系统的优化方案,展现问题解决能力
- 突出缓存系统或存储系统的设计经验,尤其包含KV Cache、Checkpoint等优化案例
- 展示在训练推理框架(如PyTorch、vLLM)上的实际应用与性能提升数据
- 强调性能优化成果,比如延迟降低、吞吐提升或稳定性改进,用数字说话
- 如有顶会论文或开源贡献,务必列在显眼位置
- 补充强化学习的基础知识,了解RL训练流程及对存储传输的特殊要求
- 研读主流开源框架(如vLLM、NCCL)的核心源码,理解其实现原理
面试指南
- 采用STAR法则,清晰阐述背景、任务、行动和结果,重点突出技术决策和量化收益
- 从系统全栈视角分析问题,区分计算、存储和网络瓶颈,分层给出解决方案
- 展示对前沿技术的追踪,提出自己的判断和落地方案
- 请详细介绍你过去做过的一个缓存/存储系统,包括架构设计、性能优化思路和最终效果
- 解释KV Cache的作用,以及你会如何优化它的内存占用和访问速度?
- 针对强化学习场景,你认为数据缓存和传输面临哪些特有挑战?如何应对?
- 如何优化分布式训练中的通信开销?请结合NCCL或RDMA谈谈具体方法
- 你最近读过哪些与存储或AI系统相关的顶会论文?有什么可借鉴的?
职位点评
74
综合评分
蚂蚁AI基础设施核心研发,前沿技术栈,高成长高回报,但强度和节奏需适应。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度和职业成长的资深工程师,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值65
薪资福利
80较高
薪资未明确指出,但蚂蚁平台和自身技术定位通常提供有竞争力的薪酬,整体回报较好。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
90较高
职位处于AI基础设施技术前沿,涉及强化学习与存储系统,技能成长空间极大。
技术前沿前沿/新兴技术
技术栈Python、C++、KV Cache、强化学习、PyTorch、vLLM、NCCL、RDMA
业务类型ambiguous
工作生活
50较低
工作地点在杭州或北京,要求现场办公,未提及弹性安排,生活灵活性一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
65中等
团队追求探索智能上限,具有较强的前沿驱动力,但未直接强调社会价值,意义感更多来自技术推动。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs