
蚂蚁集团
蚂蚁集团-垂类模型后训练科学家-北京/杭州/上海【AGI专项】
蚂蚁集团-垂类模型后训练科学家-北京/杭州/上海【AGI专项】
发布于 大约 15 小时前普通员工/个人贡献者
北京市 / 上海市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Dpo
Grpo
Ppo
Pytorch
Reward Model
Rlhf
Sft
Vllm
大模型后训练
AI 估算 · 40k–70k
大模型方向高级科学家,技术稀缺度高,蚂蚁集团薪资有竞争力,一线城市标准。
职位详情
关于这个职位
该职位负责蚂蚁集团垂类大模型(如金融领域)的后训练阶段算法研发,包括指令微调、对齐算法、Reward Model构建,以及基于强化学习的仿真环境搭建
你将专注于提升模型在专业对话、复杂逻辑推理和合规风控方面的能力,工作内容前沿且挑战性高
最低要求
● 计算机科学、人工智能或相关专业背景,具备大模型后训练实战经验
● 精通 SFT、RLHF(PPO/DPO/GRPO)及对齐算法,具备构建复杂奖励模型(Reward Model)的实战经验
● 理解Agentic技术栈,有仿真环境构建、工具调用(Tool Use)及多轮决策轨迹合成的相关研发经验
● 具备扎实的算法工程实现能力,熟悉 PyTorch、Megatron、vLLM 等主流训练推理框架,能够解决从数据合成到模型落地的全链路工程问题,有handson进行修改的能力
● 具备良好的定义、分析和解决问题能力,具备敏锐的数据洞察力
● 具备较强的团队合作和沟通能力,能够与工程团队、产品团队或其他相关团队紧密配合
工作职责
负责垂类大模型后训练(Post-training)阶段的算法研发工作
设计并优化高质量的指令数据微调(SFT)与对齐(Alignment)工作,构建针对如金融事实性、合规性及逻辑推理的 Reward 模型系统,激发模型的专业对话、复杂逻辑推理及合规风控能力
构建基于 Agentic-RL 的金融数据仿真环境及 API 对接体系,通过合成高质量多轮决策轨迹,打造具备极致专业性与安全性的垂类行业模型
优先资格
● Curiosity-driven(极强的好奇心)
● Following the First Principle(坚持第一性原理解决问题)
● Good research taste(卓越的研究品味)
● Good data taste(极佳的数据审美)
● Strong Algorithm & System Co-design capability(具备算法与系统协同设计的全局视野,能通过训练框架优化解决算法扩展性瓶颈)
● Performance optimization experience(具备训练或推理性能优化经验,熟悉 CUDA/Triton 算子开发、显存优化或通信加速技术,致力于极致压榨硬件算力以提升实验迭代效率)
● Full-stack coding skills(全栈工程能力)
● Interdisciplinary background(金融+计算机/数学的复合背景,弥合业务与算法的鸿沟)
AI 洞察
优缺点分析
优点
- 技术前沿:接触大规模模型后训练核心算法,积累稀缺的RLHF和Agentic-RL经验
- 平台优势:蚂蚁集团提供海量金融数据和算力资源,研究落地场景明确
- 薪资竞争力:高薪+股票期权,大厂福利完善
- 工作强度:互联网大厂节奏较快,可能存在加班,需适应高强度研发
- 技术难度:对算法和工程能力要求极高,需同时掌握训练框架底层优化和业务建模
- 竞争激烈:AGI方向人才密度高,需持续保持学习和输出
- 适合对AGI技术有强烈热情、具备扎实的算法工程背景、希望在垂类大模型领域深耕的资深研究员或工程师
缺点 / 挑战
暂无明显挑战项
角色解读
- 技术纵深:从后训练算法专家成长为AGI领域的技术Leader,主导模型能力突破
- 横向扩展:向多模态、强化学习等方向拓展,成为全栈型AI科学家
- 业务影响力:深入金融业务,将算法能力转化为实际产品价值,晋升为技术总监或首席科学家
- 设计和优化SFT与Alignment算法,提升垂类大模型在金融领域的专业性和合规性
- 构建Reward Model系统,针对金融事实性、逻辑推理等维度进行精细建模
- 基于Agentic-RL搭建金融仿真环境,合成多轮对话轨迹以训练模型
- 与工程和产品团队协作,推动从数据合成到模型落地的全链路工程优化
- 精通大模型后训练技术,包括SFT、RLHF(PPO/DPO/GRPO)及对齐算法
- 熟悉Agentic技术栈,具备仿真环境构建和Tool Use开发经验
- 扎实的算法工程能力,熟练使用PyTorch、Megatron、vLLM等框架
- 良好的问题分析和数据洞察力,以及跨团队协作能力
申请策略
- 提前了解蚂蚁的金融业务场景,思考大模型在风控、客服等领域的应用
- 在面试中展示好奇心和第一性原理思维,准备1-2个技术深度剖析案例
- 突出大模型后训练项目经验,尤其是SFT、RLHF、Reward Model的实际落地案例
- 展示强化学习或Agent系统相关的仿真环境构建经历
- 强调算法工程能力,如PyTorch/框架修改、性能优化、CUDA算子开发等
- 如有金融背景或跨学科经历,需重点提及
- 若RLHF经验不足,可补强PPO/DPO/GRPO算法原理及实现
- 学习Agentic-RL框架,如LangChain、AutoGPT等,并动手搭建仿真环境
面试指南
- STAR法则:描述情境、任务、行动、结果,突出量化成果和技术细节
- 问题拆解:先定义问题,再分析可能原因,最后给出方案和权衡
- 技术深度:展示对底层原理的理解,如Pytorch autograd机制、通信拓扑等
- 请详细描述你参与过的RLHF项目,包括Reward Model设计和PPO训练中的关键挑战
- 如何设计一个金融场景的Agentic-RL仿真环境?需要考虑哪些因素?
- 如果SFT后模型出现幻觉问题,你会如何从数据或算法层面改进?
- 你如何优化大模型训练效率,比如显存或通信瓶颈?请举例
- 解释第一性原理在解决大模型对齐问题中的具体应用
职位点评
76
综合评分
技术前沿、薪资丰厚的AGI研究岗,但工作强度和加班风险较高。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合极度重视技术成长、愿意投入高强度工作以获取前沿AI技能的发展型人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值70
薪资福利
85较高
蚂蚁集团薪资竞争力强,福利完善(五险一金、补充医疗、股票期权等),但JD未明确说明具体薪资和福利细节,但基于行业地位推断较好。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
95较高
该职位处于大模型技术最前沿,涉及RLHF、Agentic-RL等新兴技术,成长空间极大,JD明确要求好奇心和第一性原理,有利于持续学习。
技术前沿前沿/新兴技术
技术栈大模型后训练、SFT、RLHF、PPO、DPO、GRPO、Reward Model、Agentic-RL、PyTorch、Megatron、vLLM、CUDA、Triton
业务类型profit_center
工作生活
40较低
职位要求现场办公,且未提及弹性工作或WLB,蚂蚁集团作为互联网大厂,通常工作强度较高,可能面临加班。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
70中等
金融领域大模型有助于提升金融服务效率和安全性,具有一定社会价值,但比纯医疗/环保等岗位意义感略弱,且JD未强调使命。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs