
蚂蚁集团
蚂蚁集团-后训练算法工程师-智能风控
蚂蚁集团-后训练算法工程师-智能风控
发布于 大约 3 小时前普通员工/个人贡献者
上海市 / 杭州市
高级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Cot
Deepspeed
Dpo
Grpo
Megatron
Pytorch
Rl
Sft
大模型后训练
AI 估算 · 30k–60k
大模型算法岗稀缺,蚂蚁集团薪资竞争力强,结合技术难度与行业溢价,月薪中位数约45K。
职位详情
关于这个职位
该职位是蚂蚁集团大安全资金风控团队的核心算法岗位,专注于将前沿大模型技术落地于亿级用户的风控场景
你将负责大模型的后训练优化、知识蒸馏、数据合成以及Agent能力建设,通过SFT/RL等方法提升模型的判别与推理能力,直接保障用户的支付安全体验
工作涉及百亿级参数模型训练与分布式框架,适合在大模型领域有深厚技术积累的算法工程师
最低要求
计算机科学/人工智能、数学/统计学、电子信息工程等相关专业硕士或以上学历,有大模型训练或深度学习相关经验
熟练掌握大模型后训练方法,有百亿级参数模型训练经验者优先
熟练掌握 PyTorch 及分布式训练框架(DeepSpeed/Megatron 等),具备良好的工程落地能力
突出的分析问题和解决问题能力,自我驱动,具备较强的学习能力、创新应用能力及沟通协调能力
工作职责
大模型后训练(SFT/RL),负责多任务合训中的任务干扰、文本长度偏差等关键问题的研究,探索 DPO/GRPO/GSPO 等强化学习算法在复杂判别场景的应用,提升模型的指令遵循能力与场景泛化性
知识蒸馏,探索大参数量教师模型向小参数量学生模型的推理能力迁移方法,包括 CoT 思维链蒸馏与推理逻辑对齐,在保持判别精度的同时大幅降低部署成本
数据合成与自动标注,研究基于大模型的数据自动标注与质量筛选方法,构建高质量训练数据飞轮,提升训练数据的多样性与标签准确率
Agent 模型能力建设,研究智能体的 Tool 调用准确率提升、记忆压缩、多轮交互优化等问题,通过在真实业务场景中的轨迹采集与强化学习,持续优化模型的工具使用与自主决策能力
优先资格
有智能体(Agent)Tool 调用优化、多轮 RL 训练经验者优先
在 ICML、NeurIPS、ICLR、ACL、EMNLP 等顶会发表过论文或有竞赛经验者优先
AI 洞察
优缺点分析
优点
- 技术前沿性强:直接参与大模型后训练、RL、Agent等最热门方向,技能积累含金量高
- 业务场景真实且重要:风控场景对模型可靠性要求高,可以做出有影响力的产品
- 蚂蚁集团平台大,资源丰富,有机会接触到大规模数据和算力
- 团队学术氛围浓厚,鼓励顶会论文发表,适合追求学术与工业结合的人才
缺点 / 挑战
- 技术难度较高:需要同时掌握后训练、蒸馏、数据合成、Agent等多方面知识,学习曲线陡峭
- 业务压力大:风控场景对模型准确性和推理效率要求极高,需要持续优化和快速迭代
- 竞争激烈:蚂蚁集团人才密集,内部晋升和绩效压力较大
- 适合具备大模型训练经验、热爱技术挑战、希望在工业界前沿领域深耕的算法工程师,尤其是对强化学习、知识蒸馏和Agent有浓厚兴趣的求职者
角色解读
- 技术深度方向:后训练算法专家 → 大模型技术负责人 → 风控AI科学家
- 业务广度方向:风控算法工程师 → 风控技术架构师 → 安全业务负责人
- 跨领域方向:积累大模型与Agent经验后,可转至通用AI平台或AI产品团队
- 负责大模型的后训练优化,包括SFT、RL等方法,解决多任务合训中的干扰和长度偏差问题,提升模型在风控场景的指令遵循能力
- 进行知识蒸馏,将大参数量教师模型的推理能力迁移到小参数量学生模型,通过CoT蒸馏和逻辑对齐降低部署成本
- 研究数据合成与自动标注技术,构建高质量训练数据飞轮,提升数据多样性和标注准确率
- 建设Agent模型能力,优化工具调用、记忆压缩和多轮交互,通过轨迹采集和强化学习提升自主决策能力
- 扎实的大模型后训练经验,熟悉SFT、RLHF、DPO等算法,有百亿级参数模型训练经验者优先
- 精通PyTorch及分布式训练框架(DeepSpeed/Megatron),具备工程化落地能力
- 对知识蒸馏、数据合成、Agent优化有深入理解,能独立设计实验方案
- 较强的分析问题和解决问题能力,自我驱动,善于沟通协作
申请策略
- 蚂蚁集团面试非常注重算法原理和工程细节,准备时不要只懂调参,要理解底层数学推导
- 可以提前了解蚂蚁风控的业务背景,在面试中展示技术如何与业务结合
- 突出大模型后训练项目经验,包括使用的算法、模型规模、训练框架以及效果提升指标
- 强调分布式训练工程能力,如DeepSpeed/Megatron的使用经验,以及训练效率优化案例
- 如果有知识蒸馏、数据合成或Agent相关项目,单独列出并说明技术方案和结果
- 列出顶会论文或竞赛奖项,即使是大模型相关方向的项目也可以
- 系统学习强化学习在语言模型中的应用(RLHF、DPO、GRPO等),尝试复现相关论文
- 动手实践Agent框架(如LangChain、AutoGPT),熟悉工具调用和记忆机制
面试指南
- 对于算法对比问题:先阐述原理,然后结合实际项目经验说明选择依据和效果差异
- 对于工程问题:描述具体场景、难点、解决方案和最终效果,突出分析过程和实验设计
- 对于开放性问题:从问题定义、现有方法、你的创新点、实验验证、总结反思的结构回答
- 请详细讲解DPO与GRPO的区别,以及你在实际项目中如何选择?
- 你在多任务合训中遇到过任务干扰问题吗?如何解决的?
- 描述一下你做过的一个知识蒸馏项目,教师和学生模型的结构差异,以及蒸馏策略
- Agent的Tool调用准确率如何提升?请结合强化学习思路说明
- 如何处理训练数据中的噪声?你设计过哪些数据筛选或合成策略?
职位点评
77
综合评分
大厂核心岗位,前沿技术栈,发展空间大,但工作强度高且需现场办公。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术深度与职业成长的算法工程师,愿意接受高强度工作以换取前沿技能和行业影响力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值75
薪资福利
85较高
蚂蚁集团作为互联网巨头,薪资水平具有极强竞争力,且福利完善,但JD中未明确薪资具体范围,因此补偿性动机较高但非顶级。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
95较高
该职位涉及最前沿的大模型技术,团队鼓励顶会论文发表,且有百亿级模型训练资源,发展性动机得到极强满足。
技术前沿前沿/新兴技术
技术栈大模型后训练、SFT、RL、DPO、GRPO、知识蒸馏、数据合成、Agent、CoT、DeepSpeed、Megatron
业务类型profit_center
工作生活
40较低
工作地点在上海或杭州,均为一线城市,但需要现场办公,且互联网公司通常工作时间较长,JD中未提及弹性工作或WLB,生活化动机满足程度较低。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
75中等
风控业务直接保障用户支付安全,具有较高的社会价值,但公司是商业机构,使命驱动感中等偏上。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs