Ant Group logo
蚂蚁集团
蚂蚁集团-大语言模型强化学习算法专家-北京/上海/杭州【AGI专项】

蚂蚁集团-大语言模型强化学习算法专家-北京/上海/杭州【AGI专项】

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 上海市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Deepspeed
Megatron
Ppo
Pytorch
Scaling Law
大语言模型
奖励模型
强化学习
Reinforce

AI 估算 · 45k–80k

大模型强化学习方向热门,蚂蚁集团技术实力强,算法专家薪资高,且具备竞争力。

职位详情

关于这个职位

该职位专注于大语言模型的强化学习算法研发,致力于提升模型在数学、代码等领域的推理能力

你将负责奖励模型建模、PPO等强化学习训练以及Scaling Law研究,与蚂蚁集团AGI专项团队共同推动大模型技术前沿
适合有强化学习和分布式训练经验的算法工程师

最低要求

硕士及以上学历,计算机科学或相关专业背景

有大模型相关的研究经历,在post-training方向具备一定的训练经验,熟悉奖励模型建模,PPO/REINFORCE/RLOO等主流强化学习算法
具备扎实的算法工程实现能力,熟悉Python编程语言和PyTorch深度学习框架,熟悉DeepSpeed/Megatron等主流分布式训练框架
具备良好的分析和问题解决能力、优秀的工程素养,能够独立思考和解决实际问题
具备较强的团队合作能力和沟通能力,能够与工程团队、业务团队、产品团队和其他技术团队紧密配合

工作职责

负责研发大语言模型强化学习算法,提升大模型在强化学习阶段的训练效率,以及提升大模型在数学、代码等自然科学领域的推理能力

负责研发奖励和评价模型,包括细粒度的过程监督和奖励建模,覆盖复杂推理、指令遵循等各种任务
参与后训练和推理阶段的Scaling Law研究,包括奖励模型训练、强化学习训练、推理阶段的Scaling Law

优先资格

在语言大模型和机器学习领域有科研或实践经验,在国际顶级会议/期刊发表过高质量论文

在大数据处理、大规模分布式计算、分布式训练等领域有科研或实践经历

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台大,资源充足,AGI专项重视度高,发展空间大
  • 大模型强化学习是当前AI最前沿方向之一,技术积累极具价值
  • 团队拥有大规模分布式训练基础设施,能接触真实的超大规模模型训练
  • 职位要求高,需要扎实的理论和工程能力,竞争激烈
  • 涉及大规模实验,可能需要较强的时间管理能力和抗压能力
  • 强化学习训练不稳定,调试难度大,对耐心和深度思考有要求
  • 适合有强化学习和大模型训练经验、热爱算法研究、追求技术前沿的工程师

缺点 / 挑战

暂无明显挑战项

角色解读

  • 从算法专家向技术专家或技术负责人方向发展,领导强化学习算法团队
  • 深入大模型前沿,有机会参与顶级会议论文发表和行业标准制定
  • 向AGI方向深入,成为该领域的核心人才
  • 研发大语言模型的强化学习算法,优化训练效率,提升数学、代码等领域的推理能力
  • 构建细粒度的奖励和评价模型,用于复杂推理和指令遵循任务
  • 参与后训练和推理阶段的Scaling Law研究,探索模型规模与性能的规律
  • 扎实的机器学习与强化学习基础,熟悉PPO、REINFORCE、RLOO等算法
  • 熟练使用Python和PyTorch,掌握DeepSpeed/Megatron等分布式训练框架
  • 具备良好的算法工程实现能力和问题解决能力,能独立研究和工程落地

申请策略

  • 在简历中明确关联大语言模型强化学习经验,使用具体指标量化成果
  • 关注蚂蚁集团AGI专项的公开技术分享,在面试中展示对业务方向的理解
  • 突出在大模型post-training或强化学习方面的项目经验,如RLHF、奖励模型设计
  • 强调分布式训练经验,包括使用DeepSpeed/Megatron的实践
  • 展示在数学/代码等推理任务上的成果,如论文、开源项目或比赛成绩
  • 说明编程能力和工程素养,如Python优化、调试大型训练任务
  • 复习强化学习基础,熟练掌握PPO等算法,并了解其变体
  • 熟悉主流分布式训练框架的细节,如ZeRO、张量并行等

面试指南

  • 回答技术问题时,先阐述核心概念,再结合项目经验举例,最后总结关键点
  • 对于设计类问题,采用“目标-方法-验证”的结构,明确评价指标和可行性
  • 对于工程问题,强调系统性思考,从性能、稳定性、成本等角度分析
  • 请详细说明PPO算法的原理和实现细节,以及可能出现的问题
  • 你如何设计奖励模型来提升数学推理能力?请给出具体思路
  • 在大规模分布式训练中,如何处理显存不足或通信瓶颈?
  • 请分享一个你主导的强化学习项目,遇到的挑战和解决方案
  • 如何评估和选择Scaling Law?在训练和推理阶段有何不同?

职位点评

74
综合评分

高薪前沿技术岗,成长空间大,但需现场办公且工作强度可能较高

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿和职业成长的算法工程师,能接受一定工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值60

薪资福利

80较高

该职位薪资水平高,大厂福利完善,能较好满足补偿性动机。

薪资信号未披露(AI估算:45K-80K/月)

成长发展

90较高

大模型强化学习是前沿技术,蚂蚁集团AGI专项提供顶级平台,发展机会极佳。

技术前沿前沿/新兴技术
技术栈大语言模型、强化学习、PPO、REINFORCE、RLOO、PyTorch、DeepSpeed、Megatron、奖励模型、Scaling Law
业务类型ambiguous

工作生活

50较低

该职位需现场办公,未提及弹性或远程,大模型训练可能涉及高强度工作。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

60中等

该职位推动大模型技术发展,可能对AI领域产生积极影响,但直接社会价值不明显。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs