
蚂蚁集团
蚂蚁集团-大语言模型强化学习算法专家-北京/上海/杭州【AGI专项】
蚂蚁集团-大语言模型强化学习算法专家-北京/上海/杭州【AGI专项】
发布于 大约 14 小时前普通员工/个人贡献者
北京市 / 上海市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Deepspeed
Megatron
Ppo
Pytorch
Scaling Law
大语言模型
奖励模型
强化学习
Reinforce
AI 估算 · 45k–80k
大模型强化学习方向热门,蚂蚁集团技术实力强,算法专家薪资高,且具备竞争力。
职位详情
关于这个职位
该职位专注于大语言模型的强化学习算法研发,致力于提升模型在数学、代码等领域的推理能力
你将负责奖励模型建模、PPO等强化学习训练以及Scaling Law研究,与蚂蚁集团AGI专项团队共同推动大模型技术前沿
适合有强化学习和分布式训练经验的算法工程师
最低要求
硕士及以上学历,计算机科学或相关专业背景
有大模型相关的研究经历,在post-training方向具备一定的训练经验,熟悉奖励模型建模,PPO/REINFORCE/RLOO等主流强化学习算法
具备扎实的算法工程实现能力,熟悉Python编程语言和PyTorch深度学习框架,熟悉DeepSpeed/Megatron等主流分布式训练框架
具备良好的分析和问题解决能力、优秀的工程素养,能够独立思考和解决实际问题
具备较强的团队合作能力和沟通能力,能够与工程团队、业务团队、产品团队和其他技术团队紧密配合
工作职责
负责研发大语言模型强化学习算法,提升大模型在强化学习阶段的训练效率,以及提升大模型在数学、代码等自然科学领域的推理能力
负责研发奖励和评价模型,包括细粒度的过程监督和奖励建模,覆盖复杂推理、指令遵循等各种任务
参与后训练和推理阶段的Scaling Law研究,包括奖励模型训练、强化学习训练、推理阶段的Scaling Law
优先资格
在语言大模型和机器学习领域有科研或实践经验,在国际顶级会议/期刊发表过高质量论文
在大数据处理、大规模分布式计算、分布式训练等领域有科研或实践经历
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台大,资源充足,AGI专项重视度高,发展空间大
- 大模型强化学习是当前AI最前沿方向之一,技术积累极具价值
- 团队拥有大规模分布式训练基础设施,能接触真实的超大规模模型训练
- 职位要求高,需要扎实的理论和工程能力,竞争激烈
- 涉及大规模实验,可能需要较强的时间管理能力和抗压能力
- 强化学习训练不稳定,调试难度大,对耐心和深度思考有要求
- 适合有强化学习和大模型训练经验、热爱算法研究、追求技术前沿的工程师
缺点 / 挑战
暂无明显挑战项
角色解读
- 从算法专家向技术专家或技术负责人方向发展,领导强化学习算法团队
- 深入大模型前沿,有机会参与顶级会议论文发表和行业标准制定
- 向AGI方向深入,成为该领域的核心人才
- 研发大语言模型的强化学习算法,优化训练效率,提升数学、代码等领域的推理能力
- 构建细粒度的奖励和评价模型,用于复杂推理和指令遵循任务
- 参与后训练和推理阶段的Scaling Law研究,探索模型规模与性能的规律
- 扎实的机器学习与强化学习基础,熟悉PPO、REINFORCE、RLOO等算法
- 熟练使用Python和PyTorch,掌握DeepSpeed/Megatron等分布式训练框架
- 具备良好的算法工程实现能力和问题解决能力,能独立研究和工程落地
申请策略
- 在简历中明确关联大语言模型强化学习经验,使用具体指标量化成果
- 关注蚂蚁集团AGI专项的公开技术分享,在面试中展示对业务方向的理解
- 突出在大模型post-training或强化学习方面的项目经验,如RLHF、奖励模型设计
- 强调分布式训练经验,包括使用DeepSpeed/Megatron的实践
- 展示在数学/代码等推理任务上的成果,如论文、开源项目或比赛成绩
- 说明编程能力和工程素养,如Python优化、调试大型训练任务
- 复习强化学习基础,熟练掌握PPO等算法,并了解其变体
- 熟悉主流分布式训练框架的细节,如ZeRO、张量并行等
面试指南
- 回答技术问题时,先阐述核心概念,再结合项目经验举例,最后总结关键点
- 对于设计类问题,采用“目标-方法-验证”的结构,明确评价指标和可行性
- 对于工程问题,强调系统性思考,从性能、稳定性、成本等角度分析
- 请详细说明PPO算法的原理和实现细节,以及可能出现的问题
- 你如何设计奖励模型来提升数学推理能力?请给出具体思路
- 在大规模分布式训练中,如何处理显存不足或通信瓶颈?
- 请分享一个你主导的强化学习项目,遇到的挑战和解决方案
- 如何评估和选择Scaling Law?在训练和推理阶段有何不同?
职位点评
74
综合评分
高薪前沿技术岗,成长空间大,但需现场办公且工作强度可能较高
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿和职业成长的算法工程师,能接受一定工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值60
薪资福利
80较高
该职位薪资水平高,大厂福利完善,能较好满足补偿性动机。
薪资信号未披露(AI估算:45K-80K/月)
成长发展
90较高
大模型强化学习是前沿技术,蚂蚁集团AGI专项提供顶级平台,发展机会极佳。
技术前沿前沿/新兴技术
技术栈大语言模型、强化学习、PPO、REINFORCE、RLOO、PyTorch、DeepSpeed、Megatron、奖励模型、Scaling Law
业务类型ambiguous
工作生活
50较低
该职位需现场办公,未提及弹性或远程,大模型训练可能涉及高强度工作。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
60中等
该职位推动大模型技术发展,可能对AI领域产生积极影响,但直接社会价值不明显。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs