Ant Group logo
蚂蚁集团
蚂蚁集团-存储系统研发专家-杭州/北京

蚂蚁集团-存储系统研发专家-杭州/北京

发布于 大约 13 小时前

普通员工/个人贡献者

北京市 / 杭州市
专家级经验
全职员工
仅现场办公
学历未注明
软件工程
Kv Cache
Nccl
Pytorch
Rdma
Vllm
分布式训练
存储系统
强化学习

AI 估算 · 40k–70k

专家级AI基础设施研发,杭州/北京,蚂蚁平台,薪资竞争力强。

职位详情

关于这个职位

该职位负责蚂蚁集团下一代AI基础设施中的高性能数据缓存系统研发,聚焦强化学习场景

工作内容包括KV Cache优化、Checkpoint加速、权重同步等,要求精通C++/Python并熟悉主流训推框架
你将与顶尖团队共同探索智能上限,适合热爱底层技术的资深研发

最低要求

精通 Python/C++ 等编程语言,并有良好的代码风格

具有训推场景缓存系统设计与研发优化经验,例如 KV Cache、Checkpoint Engine 等
了解主流训推框架原理和代码实现,例如 TensorFlow/PyTorch/Megatron/Deepspeed/vLLM/Sglang 等
了解强化学习以及各主流分类场景的原理和实现
好奇心强,热爱技术

工作职责

负责建设面向训推一体的高性能数据缓存系统,服务蚂蚁内部的强化学习场景

通过存算结合持续提升和优化传统训练和推理场景的效率和稳定性,例如 KV Cache 性能优化、Checkpoint FO 加速等
同时解决强化场景特有的数据缓存和高性能传输需求,例如权重同步、Agentic RL 多轮对话场景下的 FO 加速等问题
持续探索和发现强化学习业界的前沿进展和问题,并在蚂蚁内部落地相关方案

优先资格

熟悉至少一种主流的强化框架,如 OpenRLHF/AReal/veRL/ChatLearn 等

基于存算结合在训推、强化场景有效率提升或者稳定性优化经验
熟悉 NCCL、GDR、GDS、RDMA、或有大规模训练网络通信优化经验
在计算机系统顶会 OSDI/SOSP/FAST/ATC/EuroSys 等上有文章发表经验

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台实力雄厚,业务场景丰富,可接触核心AI基础设施
  • 技术前沿,聚焦强化学习和存储系统,个人成长空间巨大
  • 团队氛围鼓励创新,有资源将新想法落地到实际生产环境
  • 技术复杂度高,需要扎实的系统功底和持续的学习投入
  • 领域竞争激烈,需不断跟踪学界与业界最新进展
  • 适合对底层系统有浓厚兴趣、喜欢攻克性能难题、具备较强自驱力的资深研发工程师

缺点 / 挑战

  • 高强度研发节奏可能带来较大压力,需适应快速迭代

角色解读

  • 在AI基础设施领域深耕,成为存储与系统优化的行业专家
  • 向技术架构师或团队技术负责人方向发展,主导核心系统设计
  • 有机会在OSDI等顶会发表成果,提升学术影响力和行业话语权
  • 设计并实现面向强化学习场景的高性能数据缓存系统,支撑训推一体化工作流
  • 深入优化KV Cache和Checkpoint性能,提升训练与推理的效率和稳定性
  • 解决强化学习中的权重同步、多轮对话数据流转等性能瓶颈,保障系统流畅运行
  • 持续跟踪并落地业界前沿技术方案,推动团队技术演进
  • 精通Python/C++,具备良好的工程实践和代码风格
  • 熟悉训练推理框架(如PyTorch/vLLM)及缓存系统设计原理
  • 理解强化学习基本流程和不同场景下对存储传输的需求
  • 具备分布式通信(如NCCL/RDMA)经验者更有竞争力

申请策略

  • 在申请材料中表达对ASystem技术方向的思考,展示与团队愿景的契合度
  • 可提前准备一个针对现有系统的优化方案,展现问题解决能力
  • 突出缓存系统或存储系统的设计经验,尤其包含KV Cache、Checkpoint等优化案例
  • 展示在训练推理框架(如PyTorch、vLLM)上的实际应用与性能提升数据
  • 强调性能优化成果,比如延迟降低、吞吐提升或稳定性改进,用数字说话
  • 如有顶会论文或开源贡献,务必列在显眼位置
  • 补充强化学习的基础知识,了解RL训练流程及对存储传输的特殊要求
  • 研读主流开源框架(如vLLM、NCCL)的核心源码,理解其实现原理

面试指南

  • 采用STAR法则,清晰阐述背景、任务、行动和结果,重点突出技术决策和量化收益
  • 从系统全栈视角分析问题,区分计算、存储和网络瓶颈,分层给出解决方案
  • 展示对前沿技术的追踪,提出自己的判断和落地方案
  • 请详细介绍你过去做过的一个缓存/存储系统,包括架构设计、性能优化思路和最终效果
  • 解释KV Cache的作用,以及你会如何优化它的内存占用和访问速度?
  • 针对强化学习场景,你认为数据缓存和传输面临哪些特有挑战?如何应对?
  • 如何优化分布式训练中的通信开销?请结合NCCL或RDMA谈谈具体方法
  • 你最近读过哪些与存储或AI系统相关的顶会论文?有什么可借鉴的?

职位点评

74
综合评分

蚂蚁AI基础设施核心研发,前沿技术栈,高成长高回报,但强度和节奏需适应。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和职业成长的资深工程师,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值65

薪资福利

80较高

薪资未明确指出,但蚂蚁平台和自身技术定位通常提供有竞争力的薪酬,整体回报较好。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

90较高

职位处于AI基础设施技术前沿,涉及强化学习与存储系统,技能成长空间极大。

技术前沿前沿/新兴技术
技术栈Python、C++、KV Cache、强化学习、PyTorch、vLLM、NCCL、RDMA
业务类型ambiguous

工作生活

50较低

工作地点在杭州或北京,要求现场办公,未提及弹性安排,生活灵活性一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

团队追求探索智能上限,具有较强的前沿驱动力,但未直接强调社会价值,意义感更多来自技术推动。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs