Ant Group logo
蚂蚁集团
蚂蚁集团-垂类模型后训练科学家-北京/杭州/上海【AGI专项】

蚂蚁集团-垂类模型后训练科学家-北京/杭州/上海【AGI专项】

发布于 大约 15 小时前

普通员工/个人贡献者

北京市 / 上海市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Dpo
Grpo
Ppo
Pytorch
Reward Model
Rlhf
Sft
Vllm
大模型后训练

AI 估算 · 40k–70k

大模型方向高级科学家,技术稀缺度高,蚂蚁集团薪资有竞争力,一线城市标准。

职位详情

关于这个职位

该职位负责蚂蚁集团垂类大模型(如金融领域)的后训练阶段算法研发,包括指令微调、对齐算法、Reward Model构建,以及基于强化学习的仿真环境搭建

你将专注于提升模型在专业对话、复杂逻辑推理和合规风控方面的能力,工作内容前沿且挑战性高

最低要求

● 计算机科学、人工智能或相关专业背景,具备大模型后训练实战经验

● 精通 SFT、RLHF(PPO/DPO/GRPO)及对齐算法,具备构建复杂奖励模型(Reward Model)的实战经验
● 理解Agentic技术栈,有仿真环境构建、工具调用(Tool Use)及多轮决策轨迹合成的相关研发经验
● 具备扎实的算法工程实现能力,熟悉 PyTorch、Megatron、vLLM 等主流训练推理框架,能够解决从数据合成到模型落地的全链路工程问题,有handson进行修改的能力
● 具备良好的定义、分析和解决问题能力,具备敏锐的数据洞察力
● 具备较强的团队合作和沟通能力,能够与工程团队、产品团队或其他相关团队紧密配合

工作职责

负责垂类大模型后训练(Post-training)阶段的算法研发工作

设计并优化高质量的指令数据微调(SFT)与对齐(Alignment)工作,构建针对如金融事实性、合规性及逻辑推理的 Reward 模型系统,激发模型的专业对话、复杂逻辑推理及合规风控能力
构建基于 Agentic-RL 的金融数据仿真环境及 API 对接体系,通过合成高质量多轮决策轨迹,打造具备极致专业性与安全性的垂类行业模型

优先资格

● Curiosity-driven(极强的好奇心)

● Following the First Principle(坚持第一性原理解决问题)
● Good research taste(卓越的研究品味)
● Good data taste(极佳的数据审美)
● Strong Algorithm & System Co-design capability(具备算法与系统协同设计的全局视野,能通过训练框架优化解决算法扩展性瓶颈)
● Performance optimization experience(具备训练或推理性能优化经验,熟悉 CUDA/Triton 算子开发、显存优化或通信加速技术,致力于极致压榨硬件算力以提升实验迭代效率)
● Full-stack coding skills(全栈工程能力)
● Interdisciplinary background(金融+计算机/数学的复合背景,弥合业务与算法的鸿沟)

AI 洞察

优缺点分析

优点

  • 技术前沿:接触大规模模型后训练核心算法,积累稀缺的RLHF和Agentic-RL经验
  • 平台优势:蚂蚁集团提供海量金融数据和算力资源,研究落地场景明确
  • 薪资竞争力:高薪+股票期权,大厂福利完善
  • 工作强度:互联网大厂节奏较快,可能存在加班,需适应高强度研发
  • 技术难度:对算法和工程能力要求极高,需同时掌握训练框架底层优化和业务建模
  • 竞争激烈:AGI方向人才密度高,需持续保持学习和输出
  • 适合对AGI技术有强烈热情、具备扎实的算法工程背景、希望在垂类大模型领域深耕的资深研究员或工程师

缺点 / 挑战

暂无明显挑战项

角色解读

  • 技术纵深:从后训练算法专家成长为AGI领域的技术Leader,主导模型能力突破
  • 横向扩展:向多模态、强化学习等方向拓展,成为全栈型AI科学家
  • 业务影响力:深入金融业务,将算法能力转化为实际产品价值,晋升为技术总监或首席科学家
  • 设计和优化SFT与Alignment算法,提升垂类大模型在金融领域的专业性和合规性
  • 构建Reward Model系统,针对金融事实性、逻辑推理等维度进行精细建模
  • 基于Agentic-RL搭建金融仿真环境,合成多轮对话轨迹以训练模型
  • 与工程和产品团队协作,推动从数据合成到模型落地的全链路工程优化
  • 精通大模型后训练技术,包括SFT、RLHF(PPO/DPO/GRPO)及对齐算法
  • 熟悉Agentic技术栈,具备仿真环境构建和Tool Use开发经验
  • 扎实的算法工程能力,熟练使用PyTorch、Megatron、vLLM等框架
  • 良好的问题分析和数据洞察力,以及跨团队协作能力

申请策略

  • 提前了解蚂蚁的金融业务场景,思考大模型在风控、客服等领域的应用
  • 在面试中展示好奇心和第一性原理思维,准备1-2个技术深度剖析案例
  • 突出大模型后训练项目经验,尤其是SFT、RLHF、Reward Model的实际落地案例
  • 展示强化学习或Agent系统相关的仿真环境构建经历
  • 强调算法工程能力,如PyTorch/框架修改、性能优化、CUDA算子开发等
  • 如有金融背景或跨学科经历,需重点提及
  • 若RLHF经验不足,可补强PPO/DPO/GRPO算法原理及实现
  • 学习Agentic-RL框架,如LangChain、AutoGPT等,并动手搭建仿真环境

面试指南

  • STAR法则:描述情境、任务、行动、结果,突出量化成果和技术细节
  • 问题拆解:先定义问题,再分析可能原因,最后给出方案和权衡
  • 技术深度:展示对底层原理的理解,如Pytorch autograd机制、通信拓扑等
  • 请详细描述你参与过的RLHF项目,包括Reward Model设计和PPO训练中的关键挑战
  • 如何设计一个金融场景的Agentic-RL仿真环境?需要考虑哪些因素?
  • 如果SFT后模型出现幻觉问题,你会如何从数据或算法层面改进?
  • 你如何优化大模型训练效率,比如显存或通信瓶颈?请举例
  • 解释第一性原理在解决大模型对齐问题中的具体应用

职位点评

76
综合评分

技术前沿、薪资丰厚的AGI研究岗,但工作强度和加班风险较高。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合极度重视技术成长、愿意投入高强度工作以获取前沿AI技能的发展型人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值70

薪资福利

85较高

蚂蚁集团薪资竞争力强,福利完善(五险一金、补充医疗、股票期权等),但JD未明确说明具体薪资和福利细节,但基于行业地位推断较好。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

95较高

该职位处于大模型技术最前沿,涉及RLHF、Agentic-RL等新兴技术,成长空间极大,JD明确要求好奇心和第一性原理,有利于持续学习。

技术前沿前沿/新兴技术
技术栈大模型后训练、SFT、RLHF、PPO、DPO、GRPO、Reward Model、Agentic-RL、PyTorch、Megatron、vLLM、CUDA、Triton
业务类型profit_center

工作生活

40较低

职位要求现场办公,且未提及弹性工作或WLB,蚂蚁集团作为互联网大厂,通常工作强度较高,可能面临加班。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

金融领域大模型有助于提升金融服务效率和安全性,具有一定社会价值,但比纯医疗/环保等岗位意义感略弱,且JD未强调使命。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs