Ant Group logo
蚂蚁集团
蚂蚁集团-大模型强化学习算法专家-阿福

蚂蚁集团-大模型强化学习算法专家-阿福

发布于 1 天前

普通员工/个人贡献者

北京市 / 上海市
专家级经验
全职员工
仅现场办公
硕士
机器学习工程
Ai Coding
Grpo
Ppo
Pytorch
Rl Scaling
Sglang
医疗Ai
大模型
强化学习

AI 估算 · 50k–80k

大模型强化学习算法专家稀缺,蚂蚁集团平台大,一线城市薪资高,结合岗位层级与行业水平估算。

职位详情

关于这个职位

负责蚂蚁集团医疗基础模型的大规模强化学习算法研发与训练,通过RL scaling提升模型在复杂医疗诊断、循证、分析等场景的能力

适合对PPO/GRPO等主流RL算法有深入理解、具备大模型训练经验的算法工程师,工作涉及算法与Infra协同,是前沿技术方向

最低要求

硕士及以上学历,计算机科学或相关专业背景

有大模型强化学习相关的研究经历,具备丰富的训练经验,深入理解PPO/GRPO/IcePop等主流强化学习算法
具备扎实的算法工程实现能力,熟悉Python编程语言和PyTorch深度学习框架,有开源框架Areal/verl/slime/openrlhf使用经验
熟悉AI coding,对常用工具如claude code/opencode熟练掌握
在大模型领域有科研或实践经验,在AI领域国际顶级会议/期刊发表过高质量论文优先
具备算法和infra co-design经验, 对sglang/vllm/megatron有开发优化经验优先

工作职责

负责医疗基础模型的大规模强化学习算法研发、训练,通过RL scaling 提升医疗基模在复杂医疗诊断、循证、分析等场景的能力

设计RL算法和奖励机制、提升学习效率、训练稳定性, 通过长周期、高效的学习,提升模型在复杂问题场景的推理能力
通过与Infra团队co-design, 研发和扩展agentic RL环境,通过提升交互与反馈的质量和规模实现agentic能力的泛化

优先资格

在AI领域国际顶级会议/期刊发表过高质量论文优先

对sglang/vllm/megatron有开发优化经验优先

AI 洞察

优缺点分析

优点

  • 前沿技术方向:强化学习是大模型能力提升的核心路径,岗位技术含量高,个人成长空间大
  • 平台资源丰富:蚂蚁集团拥有强大的算力和基础设施,能够支撑大规模实验和训练
  • 行业价值显著:医疗AI具有重要社会意义,提升模型能力可直接影响医疗服务质量
  • 多城市选择:北京、上海、杭州、成都均有岗位,可灵活选择工作地点
  • 跨团队协作要求高:需与Infra团队紧密配合,要求具备良好的沟通和co-design能力
  • 领域竞争激烈:大模型领域人才密集,需要持续学习保持竞争力,工作强度可能较大

缺点 / 挑战

  • 技术难度大:强化学习训练不稳定,需要深入理解算法细节并解决工程问题,门槛较高
  • 适合对强化学习和大模型充满热情、具有扎实算法与工程功底、喜欢挑战前沿技术难题的资深算法工程师

角色解读

  • 技术专家路线:从RL算法研发逐步深入大模型训练与推理优化,成为RL scaling领域的资深专家
  • 技术管理路线:未来可带领团队负责医疗基础模型的能力建设,向技术管理岗位发展
  • 跨领域发展:结合医疗行业知识,转型为医疗AI产品架构师或行业解决方案专家
  • 负责医疗基础模型的大规模强化学习算法研发,包括设计RL算法、奖励机制,提升模型在复杂诊断、推理等场景的能力
  • 与Infra团队协同设计和扩展agentic RL环境,优化交互与反馈的质量和规模,实现agentic能力泛化
  • 开展RL scaling相关实验,通过长周期训练提升模型推理能力,并跟踪前沿技术如PPO/GRPO的落地应用
  • 扎实的机器学习与强化学习基础,深入理解PPO、GRPO等主流算法,并有丰富的训练经验
  • 熟练使用Python和PyTorch,具备开源RL框架(verl/slime/openrlhf等)的使用与二次开发能力
  • 熟悉AI Coding工具(如claude code、opencode),并具备一定的Infra协同能力,了解sglang/vllm/megatron优先
  • 具备科研能力,有顶会论文发表或大模型领域实践经验者更受青睐

申请策略

  • 提前了解蚂蚁医疗基础模型团队的技术方向,思考自己的经验如何匹配
  • 准备好展示一次完整的RL训练案例,包括问题定义、算法设计、实验对比和结果分析
  • 突出大模型强化学习项目经验,特别是RL训练中的算法优化、稳定性提升等具体成果
  • 展示对PPO/GRPO等算法的深入理解,可附带相关实验数据或论文
  • 强调Python/PyTorch工程能力,以及使用verl/openrlhf等框架的实践经验
  • 如有顶会论文或开源贡献,务必醒目列出
  • 学习并实践最新的RL scaling技术(如GRPO、ICEPOP),尝试复现相关论文
  • 深入理解agentic RL环境构建,熟悉sglang/vllm等推理优化工具

面试指南

  • 对于算法原理问题,建议从数学基础、伪代码、实验对比三个层次展开,并强调实际落地中的挑战
  • 对于场景类问题,先明确问题目标和约束,再设计方案,最后用实验数据或逻辑论证可行性
  • 对于协作类问题,突出以结果为导向的沟通方式,强调工程与算法的平衡
  • 请详细讲解PPO和GRPO的算法原理及在实践中的调参经验
  • 如何设计奖励模型避免reward hacking?请结合医疗场景说明
  • 在训练大模型时遇到过哪些稳定性问题?如何解决?
  • 如何与Infra团队co-design以提升训练效率?请举例
  • 你如何看待RL scaling在医疗领域的应用前景?

职位点评

69
综合评分

前沿技术岗,大模型RL方向,发展空间大,但工作强度与WLB信号不明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合注重技术成长和前沿探索的求职者,愿意投入高强度工作以换取职业发展和行业影响力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活50
使命价值80

薪资福利

60中等

薪资未明确披露,但蚂蚁集团作为大型互联网公司通常提供具有竞争力的薪酬福利,整体补偿性处于市场水准。

薪资信号未披露(AI估算:50K-80K/月)

成长发展

90较高

岗位聚焦大模型强化学习这一前沿方向,技术成长空间大,且作为算法专家能接触核心研发,发展性动机得到高度满足。

技术前沿前沿/新兴技术
技术栈强化学习、PPO、GRPO、PyTorch、大模型、RL scaling、AI coding
业务类型ambiguous

工作生活

50较低

工作地点在一线城市,但未提及弹性办公或WLB信号,且算法训练通常需要较高投入,生活化动机满足一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

医疗AI具有显著的社会价值,技术方向处于行业前沿,能够为改善医疗诊断贡献技术力量,意义感较强。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs