
蚂蚁集团
蚂蚁集团-Agent 镜像工程师-杭州/成都
蚂蚁集团-Agent 镜像工程师-杭州/成都
发布于 大约 15 小时前普通员工/个人贡献者
杭州市 / 成都市
高级经验
全职员工
仅现场办公
学历未注明
信息技术与基础设施
Agent沙箱
Go
Harbor
Rdma
Roce
分布式存储
容器镜像
Ai模型分发
Dragonfly
AI 估算 · 40k–70k
顶尖大厂高级技术岗,AI基础设施方向稀缺,薪资竞争力强,通常包含高额年终
职位详情
关于这个职位
该职位负责蚂蚁集团AI基础设施中的镜像链路优化,专注于容器镜像与AI模型权重的高效分发
你将参与Dragonfly、Nydus等开源项目,解决Agent场景下千级沙箱并发启动的延迟与吞吐挑战,重新定义AI时代的镜像基础设施
适合对底层存储、网络和分布式系统有深厚兴趣的技术专家
最低要求
对技术充满热情,具备强烈的责任心和自驱力,能快速掌握和应用解决问题所需要的技术,优先考虑具有开源社区工作背景的候选人
具备扎实的编程能力、优秀的设计能力和代码品味,至少可以熟练掌握 Go/Rust 中的一种,并可以在需要时使用其他语言
具备扎实的计算机专业基础,包括计算机体系结构、操作系统、存储技术、文件系统和网络等
有细致的系统层软件性能调优经验——能找到瓶颈,能解释为什么慢,能用数据证明优化效果
工作职责
容器镜像与 AI 模型权重分发:参与 Dragonfly、Nydus、Harbor 等开源项目的开发落地与上游维护,构建从镜像构建、分发到按需加载的全链路优化,推动云原生场景下 AI 模型权重分发的社区标准化
Agent 沙箱镜像加速:面向 Agent 服务与 SWE RL 场景,设计高并发、低延迟的沙箱镜像加载方案——从镜像按需加载、incremental snapshot、layer 共享到本地热缓存,让千级并发沙箱毫秒级就绪成为可能
高性能存储:针对 AI 模型权重与容器镜像的 I/O 模式,优化存储链路——从镜像层存储、块设备、分布式缓存到本地持久化,让 TB 级模型分发的延迟降到极致
高性能网络:优化 P2P 分发与模型拉取的网络链路,探索 RDMA/RoCE 在大规模镜像分发场景下的最佳实践,让带宽利用率逼近物理极限
优先资格
● 熟悉容器镜像与存储管控链路:containerd, runc, kata-containers, overlayfs 等
● 有 Dragonfly, Nydus, Harbor, Ceph, JuiceFS 等镜像/存储相关项目经验
● 有 RDMA/RoCE/NCCL 等高性能网络经验,或大规模 P2P 分发系统经验
● 有 Linux VFS/块设备/文件系统内核开发经验
● 有沙箱/微虚拟机(如 Firecracker, Cloud Hypervisor)快速启动或增量快照经验
● 对主流开源软件有深入了解并对此有代码贡献
● 具有自我驱动和自我管理能力,能针对系统的不足提出改进方案并推动实现
AI 洞察
优缺点分析
优点
- 深度参与 AI 基础设施核心链路,技术含量高,紧跟行业前沿
- 蚂蚁集团平台资源丰富,开源项目影响力大,个人成长空间广阔
- 团队技术氛围浓厚,可接触 Dragonfly 等明星项目并推动社区标准化
- 对底层系统有极高要求,需要同时掌握存储、网络和容器技术,学习曲线陡峭
- 工作强度可能较大,需要应对大规模分布式系统的复杂问题
- 竞争激烈,需要持续产出高质量代码和优化成果
缺点 / 挑战
- 适合对底层系统有热情、乐于挑战极致性能、有开源情怀的资深工程师
角色解读
- 在 AI 基础设施前沿领域深耕,成为容器镜像与存储方向的专家
- 参与顶级开源社区(如 CNCF)贡献,提升行业影响力
- 横向拓展至 AI 平台架构或分布式系统架构师,负责更大规模系统设计
- 参与 Dragonfly、Nydus、Harbor 等开源项目的核心开发,优化容器镜像与AI模型权重的分发链路
- 针对 Agent 沙箱场景设计高并发、低延迟的镜像加载方案,实现毫秒级容器启动
- 优化存储和网络链路,降低 TB 级模型分发延迟,提升带宽利用率
- 精通 Go 或 Rust,具备扎实的系统编程能力
- 深入理解计算机体系结构、操作系统、存储和网络
- 有容器镜像、分布式存储或高性能网络相关经验,如 containerd、Ceph、RDMA 等
- 具备性能调优能力,能定位瓶颈并用数据验证优化效果
申请策略
- 在简历中明确体现对底层系统优化的热情和独立思考能力
- 关注蚂蚁技术博客或开源社区动态,了解团队最新方向
- 突出在容器镜像、分布式存储或高性能网络领域的项目经验,尤其是性能优化案例
- 展示开源贡献,如 Dragonfly/Nydus 的 PR 或 Issue 参与
- 强调系统编程能力(Go/Rust)和性能调优成果(数据对比)
- 深入学习 Dragonfly、Nydus、Harbor 架构,尝试本地搭建和调试
- 补充 RDMA/RoCE 或 Linux 内核文件系统知识
- 提前了解 AI 基础设施场景(如模型分发、Agent 沙箱)
面试指南
- 结合具体技术原理和实际经验,先描述问题背景,再提出优化思路,并用数据或案例支撑
- 采用分层分析方法:从计算、存储、网络等层面分别讨论瓶颈和解决方案
- 展示对开源社区的理解,如已有方案(Nydus lazy loading)的优缺点
- 请描述你对 Dragonfly 镜像分发流程的理解,以及可以优化的点
- Agent 沙箱场景下,如何实现毫秒级容器启动?请给出方案
- 如何优化大规模 P2P 分发中的带宽利用率和延迟?
- 请举例说明你曾经如何定位并解决一个系统性能瓶颈
- 你对 RDMA/RoCE 在镜像分发中的应用有什么想法?
职位点评
69
综合评分
蚂蚁集团核心AI基础设施岗位,前沿技术栈,成长性极强,但工作强度可能较大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术卓越、渴望参与前沿创新、对工作强度有耐受力的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展95
工作生活40
使命价值80
薪资福利
60中等
薪资未明确,推测处于市场高端水平,但福利未提及,稳定性中等。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
95较高
该职位涉及前沿AI基础设施技术,参与顶级开源项目,成长空间极大。
技术前沿前沿/新兴技术
技术栈Go、Rust、Dragonfly、Nydus、Harbor、RDMA、RoCE
业务类型ambiguous
工作生活
40较低
现场办公,未提及弹性工作或WLB,可能面临高强度研发节奏。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
AI基础设施是行业增长最快的赛道之一,技术创新推动社会进步,使命感和影响力强。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs