Ant Group logo
蚂蚁集团
蚂蚁集团-Agent 镜像工程师-杭州/成都

蚂蚁集团-Agent 镜像工程师-杭州/成都

发布于 大约 15 小时前

普通员工/个人贡献者

杭州市 / 成都市
高级经验
全职员工
仅现场办公
学历未注明
信息技术与基础设施
Agent沙箱
Go
Harbor
Rdma
Roce
分布式存储
容器镜像
Ai模型分发
Dragonfly

AI 估算 · 40k–70k

顶尖大厂高级技术岗,AI基础设施方向稀缺,薪资竞争力强,通常包含高额年终

职位详情

关于这个职位

该职位负责蚂蚁集团AI基础设施中的镜像链路优化,专注于容器镜像与AI模型权重的高效分发

你将参与Dragonfly、Nydus等开源项目,解决Agent场景下千级沙箱并发启动的延迟与吞吐挑战,重新定义AI时代的镜像基础设施
适合对底层存储、网络和分布式系统有深厚兴趣的技术专家

最低要求

对技术充满热情,具备强烈的责任心和自驱力,能快速掌握和应用解决问题所需要的技术,优先考虑具有开源社区工作背景的候选人

具备扎实的编程能力、优秀的设计能力和代码品味,至少可以熟练掌握 Go/Rust 中的一种,并可以在需要时使用其他语言
具备扎实的计算机专业基础,包括计算机体系结构、操作系统、存储技术、文件系统和网络等
有细致的系统层软件性能调优经验——能找到瓶颈,能解释为什么慢,能用数据证明优化效果

工作职责

容器镜像与 AI 模型权重分发:参与 Dragonfly、Nydus、Harbor 等开源项目的开发落地与上游维护,构建从镜像构建、分发到按需加载的全链路优化,推动云原生场景下 AI 模型权重分发的社区标准化

Agent 沙箱镜像加速:面向 Agent 服务与 SWE RL 场景,设计高并发、低延迟的沙箱镜像加载方案——从镜像按需加载、incremental snapshot、layer 共享到本地热缓存,让千级并发沙箱毫秒级就绪成为可能
高性能存储:针对 AI 模型权重与容器镜像的 I/O 模式,优化存储链路——从镜像层存储、块设备、分布式缓存到本地持久化,让 TB 级模型分发的延迟降到极致
高性能网络:优化 P2P 分发与模型拉取的网络链路,探索 RDMA/RoCE 在大规模镜像分发场景下的最佳实践,让带宽利用率逼近物理极限

优先资格

● 熟悉容器镜像与存储管控链路:containerd, runc, kata-containers, overlayfs 等

● 有 Dragonfly, Nydus, Harbor, Ceph, JuiceFS 等镜像/存储相关项目经验
● 有 RDMA/RoCE/NCCL 等高性能网络经验,或大规模 P2P 分发系统经验
● 有 Linux VFS/块设备/文件系统内核开发经验
● 有沙箱/微虚拟机(如 Firecracker, Cloud Hypervisor)快速启动或增量快照经验
● 对主流开源软件有深入了解并对此有代码贡献
● 具有自我驱动和自我管理能力,能针对系统的不足提出改进方案并推动实现

AI 洞察

优缺点分析

优点

  • 深度参与 AI 基础设施核心链路,技术含量高,紧跟行业前沿
  • 蚂蚁集团平台资源丰富,开源项目影响力大,个人成长空间广阔
  • 团队技术氛围浓厚,可接触 Dragonfly 等明星项目并推动社区标准化
  • 对底层系统有极高要求,需要同时掌握存储、网络和容器技术,学习曲线陡峭
  • 工作强度可能较大,需要应对大规模分布式系统的复杂问题
  • 竞争激烈,需要持续产出高质量代码和优化成果

缺点 / 挑战

  • 适合对底层系统有热情、乐于挑战极致性能、有开源情怀的资深工程师

角色解读

  • 在 AI 基础设施前沿领域深耕,成为容器镜像与存储方向的专家
  • 参与顶级开源社区(如 CNCF)贡献,提升行业影响力
  • 横向拓展至 AI 平台架构或分布式系统架构师,负责更大规模系统设计
  • 参与 Dragonfly、Nydus、Harbor 等开源项目的核心开发,优化容器镜像与AI模型权重的分发链路
  • 针对 Agent 沙箱场景设计高并发、低延迟的镜像加载方案,实现毫秒级容器启动
  • 优化存储和网络链路,降低 TB 级模型分发延迟,提升带宽利用率
  • 精通 Go 或 Rust,具备扎实的系统编程能力
  • 深入理解计算机体系结构、操作系统、存储和网络
  • 有容器镜像、分布式存储或高性能网络相关经验,如 containerd、Ceph、RDMA 等
  • 具备性能调优能力,能定位瓶颈并用数据验证优化效果

申请策略

  • 在简历中明确体现对底层系统优化的热情和独立思考能力
  • 关注蚂蚁技术博客或开源社区动态,了解团队最新方向
  • 突出在容器镜像、分布式存储或高性能网络领域的项目经验,尤其是性能优化案例
  • 展示开源贡献,如 Dragonfly/Nydus 的 PR 或 Issue 参与
  • 强调系统编程能力(Go/Rust)和性能调优成果(数据对比)
  • 深入学习 Dragonfly、Nydus、Harbor 架构,尝试本地搭建和调试
  • 补充 RDMA/RoCE 或 Linux 内核文件系统知识
  • 提前了解 AI 基础设施场景(如模型分发、Agent 沙箱)

面试指南

  • 结合具体技术原理和实际经验,先描述问题背景,再提出优化思路,并用数据或案例支撑
  • 采用分层分析方法:从计算、存储、网络等层面分别讨论瓶颈和解决方案
  • 展示对开源社区的理解,如已有方案(Nydus lazy loading)的优缺点
  • 请描述你对 Dragonfly 镜像分发流程的理解,以及可以优化的点
  • Agent 沙箱场景下,如何实现毫秒级容器启动?请给出方案
  • 如何优化大规模 P2P 分发中的带宽利用率和延迟?
  • 请举例说明你曾经如何定位并解决一个系统性能瓶颈
  • 你对 RDMA/RoCE 在镜像分发中的应用有什么想法?

职位点评

69
综合评分

蚂蚁集团核心AI基础设施岗位,前沿技术栈,成长性极强,但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术卓越、渴望参与前沿创新、对工作强度有耐受力的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展95
工作生活40
使命价值80

薪资福利

60中等

薪资未明确,推测处于市场高端水平,但福利未提及,稳定性中等。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

95较高

该职位涉及前沿AI基础设施技术,参与顶级开源项目,成长空间极大。

技术前沿前沿/新兴技术
技术栈Go、Rust、Dragonfly、Nydus、Harbor、RDMA、RoCE
业务类型ambiguous

工作生活

40较低

现场办公,未提及弹性工作或WLB,可能面临高强度研发节奏。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

AI基础设施是行业增长最快的赛道之一,技术创新推动社会进步,使命感和影响力强。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
Watch Jobs