
蚂蚁集团
蚂蚁集团-后训练数据基础设施-AGI专项
蚂蚁集团-后训练数据基础设施-AGI专项
发布于 大约 13 小时前普通员工/个人贡献者
北京市 / 杭州市
中级经验
全职员工
仅现场办公
本科
数据工程
Llmops
分布式存储
召回模型
向量检索
大模型
数据合成
AI 估算 · 30k–60k
蚂蚁集团核心AI方向,大模型基础设施人才稀缺,2-5年经验薪资竞争力强,一线城市水平。
职位详情
关于这个职位
该职位属于蚂蚁集团AGI专项,专注于后训练数据基础设施的建设
你将负责统一数据平台的架构设计与开发,涵盖批处理、流处理、交互式查询等能力,同时构建数据血缘溯源系统和多Agent协同合成链路,是大模型训练数据环节的关键角色
最低要求
熟悉 spark/ray 等计算引擎,了解分布式存储与计算原理,能优化数据处理效率,具备性能调优经验
熟悉文本、多模等不同模态的向量检索技术,有相关工程系统的调优经验
具备准备数据训练召回模型的能力,对业界的前沿数据召回的方法保持持续的追踪,持续提升召回模型的效果
具备扎实的计算机基础,本科及以上学历,2年以上工作经验
熟悉Java/python研发技术栈,具备良好的编程素养,有强烈的技术热情和快速学习能力,具备良好的执行力且目标导向,敢于担当,善于协同合作
有大模型数据预处理、SFT/RL 训练数据管线建设、或大模型实验平台(LLMOps)开发经验
工作职责
负责统一数据平台的架构设计与模块开发,涵盖批处理、流处理、交互式查询与服务化计算能力,构建高效、灵活、智能的后训练数据合成与实验的基础设施
负责构建样本级的数据全链路血缘溯源系统,实现数据种子-合成-处理-实验-评估的全生命周期可追溯,构建高可用、高吞吐的多 Agent 协同合成链路
AI 洞察
优缺点分析
优点
- 有机会接触大规模分布式计算、向量检索、多Agent协同等核心系统,技术积累含金量高
- 公司平台大,资源充足,内部有完善的技术生态和职业发展通道
- 岗位对综合技术能力要求高,需要同时掌握计算引擎、向量检索、数据管线和LLMOps等多方面知识
- 涉及基础设施研发,需要承担高可用、高吞吐的系统设计,故障排查和性能调优难度大
- 适合对大数据和AI基础设施有浓厚兴趣、喜欢解决复杂技术问题并愿意在AGI赛道持续深耕的工程师
缺点 / 挑战
- 所在团队是蚂蚁集团AGI专项,专注大模型后训练数据,处于行业前沿,技术挑战大但成长快
- 大模型领域节奏快,可能面临较大的工作压力和快速迭代的挑战
角色解读
- 在AGI数据基础设施领域深耕,成为大模型数据工程方向的专家
- 可向数据平台架构师或技术负责人方向发展,主导更大规模的数据基础设施
- 依托蚂蚁集团的业务场景,有机会拓展到更多AI基础设施和平台研发领域
- 设计和开发统一数据平台,支持批处理、流处理、交互式查询等计算能力,为后训练数据合成提供高效基础设施
- 构建样本级数据血缘溯源系统,确保数据从种子、合成、处理到实验评估的全生命周期可追溯
- 建设高可用、高吞吐的多Agent协同合成链路,优化数据处理和向量检索性能,提升召回模型效果
- 熟练掌握Spark/Ray等计算引擎,理解分布式存储与计算原理,具备性能调优能力
- 熟悉文本、多模态向量检索技术,有召回模型训练和调优经验
- 扎实的Java/Python编程基础,熟悉大数据生态和LLMOps相关工具
- 有强烈的技术热情和快速学习能力,具备目标导向和协同合作精神
申请策略
- 关注蚂蚁集团AGI方向的技术博客和开源项目,了解团队技术栈和文化
- 在简历中展现对数据基础设施的热情和持续学习能力,可准备一个相关技术分享
- 突出Spark/Ray等计算引擎的使用和调优经验,提供具体的性能优化案例和数据规模指标
- 强调向量检索、召回模型相关的项目经历,如召回率提升、系统延迟优化等量化成果
- 如有大模型数据预处理、SFT/RL数据管线或LLMOps平台开发经验,务必重点展示
- 体现Java/Python编程能力和系统架构设计能力,可以附带技术博客或开源贡献
- 补充学习大模型训练数据流程,了解SFT/RL的数据组织方式和常见问题
- 熟悉Ray等新兴计算框架,并了解向量数据库(如Milvus、FAISS)的工程实践
面试指南
- 回答技术问题时,使用STAR法则:先说明背景和任务,再描述你的具体行动,最后量化结果
- 对系统设计问题,可以从需求、架构、关键技术、容错、监控等维度分层描述
- 对于大模型相关问题,可以结合自己在项目中的实践,展示对数据质量、规模、迭代效率的思考
- 请介绍你使用Spark或Ray做过的一个数据处理任务,如何优化性能的?
- 如何设计一个高吞吐的数据合成链路?你会考虑哪些因素?
- 你如何理解数据血缘追踪系统?对于样本级血缘你会怎么做?
- 在训练召回模型时,如何处理多模态数据的向量检索?
- 你对大模型后训练的数据管线有什么了解?请谈谈经验
职位点评
69
综合评分
蚂蚁大厂核心AI方向,前沿技术栈,薪酬潜力大,但现场办公且节奏快。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合同样重视技术成长和个人能力提升、愿意在AGI基础设施领域长期深耕的工程师,对工作强度有心理预期。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活45
使命价值75
薪资福利
65中等
职位未提及具体薪资和福利,但蚂蚁集团作为头部互联网公司,薪酬竞争力强,整体补偿性较好。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
90较高
该职位涉及大模型前沿技术栈(数据合成、向量检索、LLMOps),可深度参与AGI基础设施建设,技术成长空间大。
技术前沿前沿/新兴技术
技术栈Spark、Ray、向量检索、召回模型、Java、Python、LLMOps、SFT、RL
业务类型cost_center
工作生活
45较低
职位要求现场办公(北京/杭州),未提及远程或弹性工作,大厂高强度节奏可能影响工作生活平衡。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
AGI和大模型是高速增长赛道,该岗位在蚂蚁集团AI战略中具有重要价值,能带来较强的行业使命感。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs