Ant Group logo
蚂蚁集团
【医学专项】蚂蚁集团-医学大模型后训练算法-健康事业群

【医学专项】蚂蚁集团-医学大模型后训练算法-健康事业群

发布于 大约 8 小时前

普通员工/个人贡献者

上海市 / 杭州市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Dpo
Pytorch
Rlhf
Sft
合成数据
大语言模型
奖励模型
强化学习
Agentic Training

AI 估算 · 30k–50k

蚂蚁集团高级算法岗,医学大模型方向技能要求高,上海/杭州薪资水平高,16薪为互联网大厂标配。

职位详情

关于这个职位

该职位负责蚂蚁集团健康事业群的医学大模型后训练算法研发,涉及监督微调、偏好优化、强化学习、Agentic Training等前沿技术

你将参与构建高质量医学训练数据体系,建设奖励模型与评测体系,推动模型在医学推理和任务完成度的提升
适合有深厚大模型训练经验、对医疗AI感兴趣的算法工程师

最低要求

计算机、人工智能、机器学习、数学、统计等相关专业,硕士或博士优先

具备扎实的机器学习、深度学习和大语言模型基础,熟悉 Transformer、生成式模型和大模型训练流程
熟悉 SFT、RL、偏好优化、奖励建模、过程监督或合成数据中的一种或多种技术
在以下至少一个方向有较深入的项目经验:
大模型 SFT、指令微调或领域能力注入
RLHF、RLAIF、DPO、OPD 或其他偏好优化算法
奖励模型、过程奖励模型、验证器或推理能力训练
Agentic Training、工具调用训练、合成数据或数据飞轮建设

工作职责

负责医学大模型后训练算法研发,包括监督微调、偏好优化、强化学习、过程监督和持续迭代等,提升模型在医学知识、推理和指令遵循方面的能力

建设高质量医学训练数据体系,开展数据清洗、难例挖掘、合成数据生成、质量评估、数据去重和污染检测等工作
研究面向医学推理和复杂任务的 Agentic Training,包括工具调用训练、长链路任务训练、环境反馈利用和多轮交互优化
研发适用于医学任务的奖励模型、过程奖励模型、规则验证器和模型验证器,为偏好优化和强化学习提供可靠的奖励信号
建设医学大模型评测与能力诊断体系,从事实准确性、推理稳定性、指令遵循、工具调用、安全性和任务完成度等维度评估模型

优先资格

在 NeurIPS、ICML、ICLR、ACL、EMNLP 等顶会或顶刊发表过一作论文

有百亿参数以上大模型微调、强化学习或训练优化经验
有医学大模型、临床推理或高准确性领域模型对齐经验
有高质量开源训练框架、对齐算法或数据项目核心贡献经验

AI 洞察

优缺点分析

优点

  • 前沿技术栈:接触最新的大模型后训练技术(RLHF、DPO、Agentic Training),技术积累价值高
  • 行业前景好:医疗AI是高速增长赛道,蚂蚁集团平台资源丰富,项目影响力大
  • 薪资待遇优厚:大厂高级算法岗,16薪,竞争力强
  • 技术难度高:需要同时掌握多类对齐算法和数据处理,对理论基础和工程能力要求极高
  • 医学领域壁垒:需要理解医学知识、临床推理等专业内容,学习曲线陡峭
  • 工作强度可能较大:大模型训练周期长,迭代快,需要持续投入
  • 尤其适合有顶会论文或开源项目贡献的候选人

缺点 / 挑战

  • 适合有丰富大模型训练经验、对医疗AI有热情、喜欢挑战前沿技术的算法工程师

角色解读

  • 技术深度发展:成为大模型训练与对齐领域的专家,主导下一代医学大模型的核心算法
  • 跨领域拓展:从医学向其他高准确性领域(如法律、金融)扩展,成为行业AI解决方案架构师
  • 管理路线:带领团队负责整个后训练数据与算法体系,晋升为技术总监或高级研究员
  • 负责医学大模型的后训练(post-training)算法研发,包括SFT、偏好优化、强化学习等,提升模型在医学领域的知识、推理和指令遵循能力
  • 建设高质量医学训练数据体系,涉及数据清洗、难例挖掘、合成数据生成和质量评估
  • 研究面向医学推理的Agentic Training,包括工具调用、长链路任务训练和多轮交互优化
  • 研发医学任务的奖励模型与评测体系,从事实准确性、安全性等维度评估模型
  • 扎实的机器学习、深度学习和大语言模型基础,熟悉Transformer、生成式模型和大模型训练流程
  • 精通SFT、RLHF、DPO等偏好优化或强化学习技术,并有实际项目经验
  • 具备数据处理能力,能构建合成数据或数据飞轮
  • 有百亿参数大模型微调或训练优化经验者优先

申请策略

  • 研究蚂蚁健康事业群的产品和医学AI成果,在面试中展示对公司业务的理解
  • 准备一个完整的后训练项目故事,从数据到模型到评测,体现系统性思维
  • 突出大模型后训练(SFT、RLHF、DPO)的实际项目经验,包括模型规模、数据量级和效果提升
  • 强调数据处理能力,如合成数据生成、难例挖掘或数据飞轮建设经验
  • 如有医学AI项目或顶会论文,单独列出并在简历显眼位置标注
  • 开源贡献如提交过训练框架的PR或发布过对齐算法工具,详细说明
  • 补充RLHF或DPO的深入实现,包括reward model训练、PPO算法等细节
  • 熟悉医学领域知识,可阅读临床指南或医学NLP相关论文

面试指南

  • 使用STAR原则:情境-任务-行动-结果,具体量化效果
  • 对比多种方法时,从理论正确性、实际效果、计算成本、易用性等角度多维分析
  • 设计评测体系时,先明确业务目标,再拆解维度(准确、安全、鲁棒等),然后制定自动化+人工的指标
  • 请详细介绍你做过的一个SFT或RLHF项目,包括数据来源、模型架构、训练策略和效果评估
  • 如何构建一个高质量的医学训练数据集?你会如何处理数据噪声和污染?
  • 比较DPO和RLHF的优缺点,在医学场景中你会选择哪个?为什么?
  • Agentic Training 怎么做?如何让模型学会工具调用和多轮交互?
  • 你如何设计一个医学大模型的评测体系?主要关注哪些维度?

职位点评

77
综合评分

大厂医学AI前沿技术岗,薪资高、技术新,但工作强度大、WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术成长和行业影响力的求职者,愿意投入高强度工作换取前沿经验和高回报。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值80

薪资福利

85较高

薪资水平高,蚂蚁大厂福利完善,但JD未提及具体薪资福利,故评分较高但非满分。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

95较高

技术前沿,成长空间大,有多个方向可深入,且蚂蚁集团提供大量资源。

技术前沿前沿/新兴技术
技术栈医学大模型、大语言模型、SFT、RLHF、DPO、Agentic Training、奖励模型、强化学习
业务类型profit_center

工作生活

40较低

工作地点需线下,未提及弹性工时或WLB,互联网大厂可能加班较多,生活化动机满足一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

80较高

医学AI有正向社会价值,蚂蚁集团品牌影响力大,但JD未特别强调使命感。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs