Ant Group logo
蚂蚁集团
蚂蚁集团-语言大模型语料优化算法工程师-北京/杭州【AGI专项】

蚂蚁集团-语言大模型语料优化算法工程师-北京/杭州【AGI专项】

发布于 大约 2 小时前

普通员工/个人贡献者

北京市 / 杭州市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Nlp
Pytorch
分布式训练
大语言模型
数学
数据合成
机器学习
算法竞赛
语料优化

AI 估算 · 30k–50k

大模型算法岗位技术稀缺,蚂蚁平台竞争力强,薪资处于市场高位;硕士+经验要求,月薪普遍在3-5万。

职位详情

关于这个职位

该职位负责蚂蚁集团大语言模型的语料优化,包括数据扩源、质量提升、合成语料及训练策略优化

你将参与预训练、后训练和强化学习阶段的语料建设,提升模型在数学、代码、推理和对话等关键能力
适合对大模型和数据驱动抱有热情、具备扎实机器学习基础和Python/PyTorch技能的算法工程师

最低要求

硕士及以上学历,计算机科学、人工智能或相关专业背景

熟练掌握机器学习、自然语言处理、大语言模型等相关领域的基本理论和算法,具备扎实的数学基础
熟练掌握Python编程语言,熟悉主流深度学习框架(如PyTorch),具备大规模数据处理和分布式训练的实际经验
具备良好的分析和解决问题能力,能够独立思考并解决复杂的技术问题
具备较强的团队合作能力和沟通能力,能够与工程、产品等团队紧密配合,共同推动项目落地
热爱人工智能领域,对探索新事物充满热情

工作职责

负责大语言模型各阶段训练语料的优化工作,包括预训练、后训练、强化学习训练阶段,具体的工作包括体系化地扩展各类型的数据、定义并迭代优化数据质量、建设高效的合成语料技术、优化高质量数据筛选策略、优化数据配比及训练策略等

负责端到端地优化基座模型的各项关键能力,包括数学、代码、推理、对话等能力,具体工作包括扩展各能力相关的语料、定义并迭代优化数据质量、针对性地合成相关语料、优化高质量数据筛选策略、优化各阶段数据配比及训练策略、优化评测方式等
负责研发语料优化相关的基础设施,包括研发高效的数据处理算子及链路、构建数据标签体系及标注模型、探索数据与模型效果的关系、设计数据效果评估机制等
跟踪和研究大模型领域的前沿技术方向,包括但不限于语料优化、预训练和后训练算法、知识增强、数据合成等,推动技术创新并应用到基座模型训练中

优先资格

有大语言模型语料优化和模型训练的实际经验

参加过算法竞赛(如Kaggle、ICPC、ACM等)、信息学、数学、物理、化学竞赛,并取得优异成绩
在顶级国际会议/期刊(如NeurIPS、ICML、ACL、CVPR等)发表过论文
有算法工程化落地经验,有主流开源算法库开发、维护或贡献经历

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台实力雄厚,AGI专项投入大,能接触业界一流的大模型训练场景
  • 工作内容前沿,涉及数据合成、强化学习等热门方向,技术成长快
  • 有充足的算力和数据资源,能真正推动基座模型能力提升
  • 可参与顶级会议和开源社区,提升个人影响力
  • 对综合能力要求高,不仅要懂算法,还要有工程实现和数据分析能力
  • 大模型领域竞争激烈,需要持续学习保持竞争力

缺点 / 挑战

  • 语料优化需要大量实验和迭代,工作强度较高
  • 适合对数据驱动大模型训练有强烈兴趣,喜欢挑战性工作,且具备扎实ML基础和工程能力的算法工程师

角色解读

  • 可向大模型算法专家或技术负责人方向发展,深耕语料与训练优化
  • 有机会参与AGI前沿项目,积累行业影响力,可转向研究或工程双路径
  • 蚂蚁集团平台大,可接触海量业务场景,未来可转入其他AI方向或创业
  • 负责大模型各阶段训练语料的质量优化与扩展,包括预训练、后训练和强化学习阶段
  • 针对数学、代码、推理、对话等能力,设计语料合成与筛选策略,提升模型表现
  • 建设语料处理基础设施,包括数据处理算子、标签体系和评测机制
  • 跟踪前沿技术,将新的语料优化方法应用到基座模型训练中
  • 扎实的机器学习和NLP基础,熟悉大模型训练原理
  • 熟练使用Python和PyTorch,有分布式训练和大规模数据处理经验
  • 良好的问题分析和数学功底,能优化数据配比和训练策略
  • 团队协作和沟通能力,能与工程、产品紧密配合

申请策略

  • 关注蚂蚁AGI专项的进展,了解团队方向,在面试中展现对语料优化的理解
  • 建议准备一个端到端的语料优化案例,说明思路和效果
  • 突出大模型或NLP相关项目经验,尤其是语料构建、模型训练优化经历
  • 强调Python/PyTorch和分布式训练的实际动手能力,可附GitHub或技术博客
  • 展示竞赛获奖或顶会论文,证明算法实力
  • 如果有数据清洗、数据合成、数据扩源等具体案例,重点描述效果
  • 提前了解大模型训练全流程,熟悉常见语料处理工具(如tokenization、数据去重等)
  • 掌握一些数据合成方法,如self-instruct、filtering等

面试指南

  • 从问题定义、数据探索、方法设计、实验验证、效果迭代的框架回答
  • 强调数据驱动的实验思维,给出具体例子和量化结果
  • 结合对模型训练的理解,说明数据与模型效果的因果关系
  • 你是如何构建或优化一个高质量的大模型训练语料的?
  • 在预训练、后训练和RLHF阶段,数据配比和数据质量分别如何影响模型效果?
  • 请讲讲你使用PyTorch进行分布式训练的经验,如何处理大规模数据?
  • 如何设计一个数据合成流程来提升模型在数学推理方面的能力?
  • 如何评估语料优化效果,常用的评价指标有哪些?

职位点评

75
综合评分

蚂蚁大模型核心算法岗,技术前沿但工作强度大,薪资福利好,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术成长和事业成就的求职者,愿意投入高强度工作以换取快速发展和行业影响力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值85

薪资福利

75中等

蚂蚁集团作为互联网巨头,提供有竞争力的薪酬和福利,但JD未具体说明薪资范围,综合评定较好。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

该岗位聚焦大模型语料优化,属于AI前沿领域,提供顶级平台和算力,技术成长极快。

技术前沿前沿/新兴技术
技术栈大语言模型、语料优化、数据合成、训练策略、PyTorch、分布式训练、NLP、强化学习
业务类型ambiguous

工作生活

50较低

该岗位未提及远程或弹性工作,大模型研发节奏快,工作强度可能较高,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

该职位直接参与打造业界一流语言基座模型,技术价值和社会影响力显著,使命驱动强。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号打造业界一流的语言基座模型
创新程度积极采用新技术
Watch Jobs