
蚂蚁集团
蚂蚁集团-大模型强化学习算法专家-阿福
蚂蚁集团-大模型强化学习算法专家-阿福
发布于 1 天前普通员工/个人贡献者
北京市 / 上海市
专家级经验
全职员工
仅现场办公
硕士
机器学习工程
Ai Coding
Grpo
Ppo
Pytorch
Rl Scaling
Sglang
医疗Ai
大模型
强化学习
AI 估算 · 50k–80k
大模型强化学习算法专家稀缺,蚂蚁集团平台大,一线城市薪资高,结合岗位层级与行业水平估算。
职位详情
关于这个职位
负责蚂蚁集团医疗基础模型的大规模强化学习算法研发与训练,通过RL scaling提升模型在复杂医疗诊断、循证、分析等场景的能力
适合对PPO/GRPO等主流RL算法有深入理解、具备大模型训练经验的算法工程师,工作涉及算法与Infra协同,是前沿技术方向
最低要求
硕士及以上学历,计算机科学或相关专业背景
有大模型强化学习相关的研究经历,具备丰富的训练经验,深入理解PPO/GRPO/IcePop等主流强化学习算法
具备扎实的算法工程实现能力,熟悉Python编程语言和PyTorch深度学习框架,有开源框架Areal/verl/slime/openrlhf使用经验
熟悉AI coding,对常用工具如claude code/opencode熟练掌握
在大模型领域有科研或实践经验,在AI领域国际顶级会议/期刊发表过高质量论文优先
具备算法和infra co-design经验, 对sglang/vllm/megatron有开发优化经验优先
工作职责
负责医疗基础模型的大规模强化学习算法研发、训练,通过RL scaling 提升医疗基模在复杂医疗诊断、循证、分析等场景的能力
设计RL算法和奖励机制、提升学习效率、训练稳定性, 通过长周期、高效的学习,提升模型在复杂问题场景的推理能力
通过与Infra团队co-design, 研发和扩展agentic RL环境,通过提升交互与反馈的质量和规模实现agentic能力的泛化
优先资格
在AI领域国际顶级会议/期刊发表过高质量论文优先
对sglang/vllm/megatron有开发优化经验优先
AI 洞察
优缺点分析
优点
- 前沿技术方向:强化学习是大模型能力提升的核心路径,岗位技术含量高,个人成长空间大
- 平台资源丰富:蚂蚁集团拥有强大的算力和基础设施,能够支撑大规模实验和训练
- 行业价值显著:医疗AI具有重要社会意义,提升模型能力可直接影响医疗服务质量
- 多城市选择:北京、上海、杭州、成都均有岗位,可灵活选择工作地点
- 跨团队协作要求高:需与Infra团队紧密配合,要求具备良好的沟通和co-design能力
- 领域竞争激烈:大模型领域人才密集,需要持续学习保持竞争力,工作强度可能较大
缺点 / 挑战
- 技术难度大:强化学习训练不稳定,需要深入理解算法细节并解决工程问题,门槛较高
- 适合对强化学习和大模型充满热情、具有扎实算法与工程功底、喜欢挑战前沿技术难题的资深算法工程师
角色解读
- 技术专家路线:从RL算法研发逐步深入大模型训练与推理优化,成为RL scaling领域的资深专家
- 技术管理路线:未来可带领团队负责医疗基础模型的能力建设,向技术管理岗位发展
- 跨领域发展:结合医疗行业知识,转型为医疗AI产品架构师或行业解决方案专家
- 负责医疗基础模型的大规模强化学习算法研发,包括设计RL算法、奖励机制,提升模型在复杂诊断、推理等场景的能力
- 与Infra团队协同设计和扩展agentic RL环境,优化交互与反馈的质量和规模,实现agentic能力泛化
- 开展RL scaling相关实验,通过长周期训练提升模型推理能力,并跟踪前沿技术如PPO/GRPO的落地应用
- 扎实的机器学习与强化学习基础,深入理解PPO、GRPO等主流算法,并有丰富的训练经验
- 熟练使用Python和PyTorch,具备开源RL框架(verl/slime/openrlhf等)的使用与二次开发能力
- 熟悉AI Coding工具(如claude code、opencode),并具备一定的Infra协同能力,了解sglang/vllm/megatron优先
- 具备科研能力,有顶会论文发表或大模型领域实践经验者更受青睐
申请策略
- 提前了解蚂蚁医疗基础模型团队的技术方向,思考自己的经验如何匹配
- 准备好展示一次完整的RL训练案例,包括问题定义、算法设计、实验对比和结果分析
- 突出大模型强化学习项目经验,特别是RL训练中的算法优化、稳定性提升等具体成果
- 展示对PPO/GRPO等算法的深入理解,可附带相关实验数据或论文
- 强调Python/PyTorch工程能力,以及使用verl/openrlhf等框架的实践经验
- 如有顶会论文或开源贡献,务必醒目列出
- 学习并实践最新的RL scaling技术(如GRPO、ICEPOP),尝试复现相关论文
- 深入理解agentic RL环境构建,熟悉sglang/vllm等推理优化工具
面试指南
- 对于算法原理问题,建议从数学基础、伪代码、实验对比三个层次展开,并强调实际落地中的挑战
- 对于场景类问题,先明确问题目标和约束,再设计方案,最后用实验数据或逻辑论证可行性
- 对于协作类问题,突出以结果为导向的沟通方式,强调工程与算法的平衡
- 请详细讲解PPO和GRPO的算法原理及在实践中的调参经验
- 如何设计奖励模型避免reward hacking?请结合医疗场景说明
- 在训练大模型时遇到过哪些稳定性问题?如何解决?
- 如何与Infra团队co-design以提升训练效率?请举例
- 你如何看待RL scaling在医疗领域的应用前景?
职位点评
69
综合评分
前沿技术岗,大模型RL方向,发展空间大,但工作强度与WLB信号不明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合注重技术成长和前沿探索的求职者,愿意投入高强度工作以换取职业发展和行业影响力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活50
使命价值80
薪资福利
60中等
薪资未明确披露,但蚂蚁集团作为大型互联网公司通常提供具有竞争力的薪酬福利,整体补偿性处于市场水准。
薪资信号未披露(AI估算:50K-80K/月)
成长发展
90较高
岗位聚焦大模型强化学习这一前沿方向,技术成长空间大,且作为算法专家能接触核心研发,发展性动机得到高度满足。
技术前沿前沿/新兴技术
技术栈强化学习、PPO、GRPO、PyTorch、大模型、RL scaling、AI coding
业务类型ambiguous
工作生活
50较低
工作地点在一线城市,但未提及弹性办公或WLB信号,且算法训练通常需要较高投入,生活化动机满足一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
医疗AI具有显著的社会价值,技术方向处于行业前沿,能够为改善医疗诊断贡献技术力量,意义感较强。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs