
蚂蚁集团
蚂蚁集团-语言大模型语料优化算法工程师-北京/杭州【AGI专项】
蚂蚁集团-语言大模型语料优化算法工程师-北京/杭州【AGI专项】
发布于 大约 2 小时前普通员工/个人贡献者
北京市 / 杭州市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Nlp
Pytorch
分布式训练
大语言模型
数学
数据合成
机器学习
算法竞赛
语料优化
AI 估算 · 30k–50k
大模型算法岗位技术稀缺,蚂蚁平台竞争力强,薪资处于市场高位;硕士+经验要求,月薪普遍在3-5万。
职位详情
关于这个职位
该职位负责蚂蚁集团大语言模型的语料优化,包括数据扩源、质量提升、合成语料及训练策略优化
你将参与预训练、后训练和强化学习阶段的语料建设,提升模型在数学、代码、推理和对话等关键能力
适合对大模型和数据驱动抱有热情、具备扎实机器学习基础和Python/PyTorch技能的算法工程师
最低要求
硕士及以上学历,计算机科学、人工智能或相关专业背景
熟练掌握机器学习、自然语言处理、大语言模型等相关领域的基本理论和算法,具备扎实的数学基础
熟练掌握Python编程语言,熟悉主流深度学习框架(如PyTorch),具备大规模数据处理和分布式训练的实际经验
具备良好的分析和解决问题能力,能够独立思考并解决复杂的技术问题
具备较强的团队合作能力和沟通能力,能够与工程、产品等团队紧密配合,共同推动项目落地
热爱人工智能领域,对探索新事物充满热情
工作职责
负责大语言模型各阶段训练语料的优化工作,包括预训练、后训练、强化学习训练阶段,具体的工作包括体系化地扩展各类型的数据、定义并迭代优化数据质量、建设高效的合成语料技术、优化高质量数据筛选策略、优化数据配比及训练策略等
负责端到端地优化基座模型的各项关键能力,包括数学、代码、推理、对话等能力,具体工作包括扩展各能力相关的语料、定义并迭代优化数据质量、针对性地合成相关语料、优化高质量数据筛选策略、优化各阶段数据配比及训练策略、优化评测方式等
负责研发语料优化相关的基础设施,包括研发高效的数据处理算子及链路、构建数据标签体系及标注模型、探索数据与模型效果的关系、设计数据效果评估机制等
跟踪和研究大模型领域的前沿技术方向,包括但不限于语料优化、预训练和后训练算法、知识增强、数据合成等,推动技术创新并应用到基座模型训练中
优先资格
有大语言模型语料优化和模型训练的实际经验
参加过算法竞赛(如Kaggle、ICPC、ACM等)、信息学、数学、物理、化学竞赛,并取得优异成绩
在顶级国际会议/期刊(如NeurIPS、ICML、ACL、CVPR等)发表过论文
有算法工程化落地经验,有主流开源算法库开发、维护或贡献经历
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台实力雄厚,AGI专项投入大,能接触业界一流的大模型训练场景
- 工作内容前沿,涉及数据合成、强化学习等热门方向,技术成长快
- 有充足的算力和数据资源,能真正推动基座模型能力提升
- 可参与顶级会议和开源社区,提升个人影响力
- 对综合能力要求高,不仅要懂算法,还要有工程实现和数据分析能力
- 大模型领域竞争激烈,需要持续学习保持竞争力
缺点 / 挑战
- 语料优化需要大量实验和迭代,工作强度较高
- 适合对数据驱动大模型训练有强烈兴趣,喜欢挑战性工作,且具备扎实ML基础和工程能力的算法工程师
角色解读
- 可向大模型算法专家或技术负责人方向发展,深耕语料与训练优化
- 有机会参与AGI前沿项目,积累行业影响力,可转向研究或工程双路径
- 蚂蚁集团平台大,可接触海量业务场景,未来可转入其他AI方向或创业
- 负责大模型各阶段训练语料的质量优化与扩展,包括预训练、后训练和强化学习阶段
- 针对数学、代码、推理、对话等能力,设计语料合成与筛选策略,提升模型表现
- 建设语料处理基础设施,包括数据处理算子、标签体系和评测机制
- 跟踪前沿技术,将新的语料优化方法应用到基座模型训练中
- 扎实的机器学习和NLP基础,熟悉大模型训练原理
- 熟练使用Python和PyTorch,有分布式训练和大规模数据处理经验
- 良好的问题分析和数学功底,能优化数据配比和训练策略
- 团队协作和沟通能力,能与工程、产品紧密配合
申请策略
- 关注蚂蚁AGI专项的进展,了解团队方向,在面试中展现对语料优化的理解
- 建议准备一个端到端的语料优化案例,说明思路和效果
- 突出大模型或NLP相关项目经验,尤其是语料构建、模型训练优化经历
- 强调Python/PyTorch和分布式训练的实际动手能力,可附GitHub或技术博客
- 展示竞赛获奖或顶会论文,证明算法实力
- 如果有数据清洗、数据合成、数据扩源等具体案例,重点描述效果
- 提前了解大模型训练全流程,熟悉常见语料处理工具(如tokenization、数据去重等)
- 掌握一些数据合成方法,如self-instruct、filtering等
面试指南
- 从问题定义、数据探索、方法设计、实验验证、效果迭代的框架回答
- 强调数据驱动的实验思维,给出具体例子和量化结果
- 结合对模型训练的理解,说明数据与模型效果的因果关系
- 你是如何构建或优化一个高质量的大模型训练语料的?
- 在预训练、后训练和RLHF阶段,数据配比和数据质量分别如何影响模型效果?
- 请讲讲你使用PyTorch进行分布式训练的经验,如何处理大规模数据?
- 如何设计一个数据合成流程来提升模型在数学推理方面的能力?
- 如何评估语料优化效果,常用的评价指标有哪些?
职位点评
75
综合评分
蚂蚁大模型核心算法岗,技术前沿但工作强度大,薪资福利好,WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术成长和事业成就的求职者,愿意投入高强度工作以换取快速发展和行业影响力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值85
薪资福利
75中等
蚂蚁集团作为互联网巨头,提供有竞争力的薪酬和福利,但JD未具体说明薪资范围,综合评定较好。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
该岗位聚焦大模型语料优化,属于AI前沿领域,提供顶级平台和算力,技术成长极快。
技术前沿前沿/新兴技术
技术栈大语言模型、语料优化、数据合成、训练策略、PyTorch、分布式训练、NLP、强化学习
业务类型ambiguous
工作生活
50较低
该岗位未提及远程或弹性工作,大模型研发节奏快,工作强度可能较高,生活平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
85较高
该职位直接参与打造业界一流语言基座模型,技术价值和社会影响力显著,使命驱动强。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号打造业界一流的语言基座模型
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs