
蚂蚁集团
网商银行-大模型后训练工程师-上海/杭州
网商银行-大模型后训练工程师-上海/杭州
发布于 大约 8 小时前普通员工/个人贡献者
上海市 / 杭州市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Dpo
Llm
Nl2Sql
Pytorch
Rag
Rlhf
Sft
大模型
AI 估算 · 35k–60k
大模型后训练稀缺技能,蚂蚁平台强,薪资竞争力高,但工作强度大。
职位详情
关于这个职位
该职位属于蚂蚁集团旗下网商银行,负责信贷领域大模型的后训练工作,包括SFT、RLHF、DPO等前沿技术
你将参与构建智能Agent系统,利用RAG、NL2SQL等实现端到端决策支持
岗位要求硕士以上学历,三年以上经验,并具备扎实的深度学习功底
适合对AI+金融方向感兴趣的技术人才
最低要求
计算机科学、人工智能、数学或相关专业的硕士及以上学历,3年以上机器学习/深度学习相关工作经验
扎实的机器学习基础,深刻理解深度学习、自然语言处理的基本原理,对Transformer架构、语言模型有深入理解
具备丰富的模型训练/微调实践经验,熟练掌握PyTorch/TensorFlow等至少一种深度学习框架
出色的编程和工程实现能力(Python)
具备优秀的问题分析和解决能力,能够独立开展实验、分析结果并定位问题,对算法创新和解决挑战性问题有浓厚兴趣
工作职责
主导信贷大模型的后训练体系:通过有监督微调(SFT)、奖励模型(RM)训练、人类反馈强化学习(RLHF)、直接偏好优化(DPO)等领域领先技术,让模型不仅“会回答”,更能“可解释、答得准、判得稳、符合专家直觉”,实现与信贷业务目标的深度对齐
构建垂直领域智能Agent系统的能力:能主导信贷场景下Intelligent Agent的核心框架设计,融合感知、规划、执行与持续学习机制,并通过知识图谱、RAG、NL2SQL等技术打通非结构化知识、结构化数据与自然语言交互,实现从行业洞察、风险画像到决策支持的端到端自动化
打造高质量领域数据飞轮:从零构建面向信贷场景的指令与偏好数据集,设计数据配比、清洗、增强与合成策略,持续提升数据效率与泛化能力——因为你知道,好模型的背后,是更聪明的数据
建立科学严谨的评估体系:构建覆盖准确性、逻辑一致性、风险敏感度、幻觉控制等多维度的自动化评测 pipeline,用数据驱动模型迭代,确保每一个版本都比上一个更可靠、更可用
站在AI+金融的最前沿:紧密跟踪全球大模型的最新进展(如新型偏好学习、多Agent协作等),快速将学术突破转化为业务生产力,解决真实世界中复杂、高 stakes 的信贷决策挑战
同时将领域化的研究转化为高质量的顶会论文,形成持续学术影响力
优先资格
具备大模型(LLM)、Agent相关项目经验者优先
有SFT、RLHF、DPO等后训练全流程实践经验者优先
熟悉分布式训练框架、深度学习性能优化(如混合精度训练、ZeRO等)者优先
在顶级会议(如NeurIPS, ICML, ICLR, ACL等)发表过相关论文,或有开源项目贡献(如参与过LLM相关项目:LLaMA-Factory, TRL等)
AI 洞察
优缺点分析
优点
- 前沿技术栈,涵盖大模型后训练、Agent等热点方向,技术含量高
- 蚂蚁集团平台,业务场景丰富,数据资源海量,有真实落地价值
- 与资深信贷专家合作,快速积累金融领域知识,拓宽行业视野
- 鼓励学术创新,有发表顶会论文和开源贡献的机会
- 技术要求高,需要扎实的ML/LLM功底和丰富的实战经验
- 金融场景对模型准确性和可靠性要求极高,容错率低
- 工作强度可能较大,需适应快速迭代和高压环境
缺点 / 挑战
- 适合热爱技术挑战、对AI+金融感兴趣、有大型模型训练经验的工程师
角色解读
- 纵深发展:成为大模型训练与对齐领域的专家,主导核心模型研发
- 横向拓展:结合金融业务,发展为AI+金融解决方案架构师
- 学术影响力:通过发表顶会论文和开源贡献,积累行业声誉
- 主导信贷大模型的后训练,包括SFT、RLHF、DPO等,让模型与业务目标深度对齐
- 构建智能Agent系统,整合知识图谱、RAG、NL2SQL,实现端到端决策自动化
- 构建领域数据飞轮,设计数据配比、清洗与合成策略,提升模型泛化能力
- 搭建自动化评估pipeline,从准确性、逻辑一致性等多个维度驱动模型迭代
- 扎实的机器学习与深度学习基础,深入理解Transformer架构和语言模型
- 熟练掌握PyTorch或TensorFlow,具备模型训练与微调实战经验
- 掌握SFT、RLHF、DPO等后训练方法,了解分布式训练和性能优化
- 编程能力强(Python),能够独立开展实验和问题定位
申请策略
- 了解决策大模型的业务价值,准备相关项目故事
- 关注蚂蚁科技的文化,强调对金融创新的热情
- 突出大模型后训练项目经验,详细描述SFT、RLHF、DPO的实践细节
- 强调模型效果的量化指标,如准确率提升、业务收益等
- 展示开源项目贡献或顶会论文,体现技术深度
- 描述金融领域或大规模分布式训练的经验
- 补充RLHF/DPO的原理和实现,熟悉主流框架如LLaMA-Factory、TRL
- 学习RAG、NL2SQL、知识图谱在Agent中的实际应用
面试指南
- 用STAR法则结构化描述项目:情境、任务、行动、结果
- 从原理到实践,先讲核心思想,再讲工程实现细节
- 突出数据驱动和实验迭代的思维方式
- 请详细描述你如何设计和实施一个RLHF训练流程?遇到过哪些问题?
- 如何评估一个大模型在信贷决策场景的可靠性和风险?
- 解释DPO与RLHF的区别及各自的优劣?
- 如何构建高质量的训练数据集?
- 你对Agent多智能体协作有哪些理解和实践?
职位点评
73
综合评分
蚂蚁旗下网商银行大模型后训练岗,技术前沿、薪资高,但WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合以技术成长为驱动、追求前沿AI领域挑战和职业发展潜力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值70
薪资福利
75中等
该职位为头部互联网公司核心算法岗,薪资水平预计高于市场平均,但JD未披露具体福利,存在不确定性。
薪资信号未披露(AI估算:35K-60K/月)
成长发展
90较高
岗位聚焦大模型后训练,处于技术前沿,成长空间大,鼓励学术创新。
技术前沿前沿/新兴技术
技术栈LLM、SFT、RLHF、DPO、Agent、PyTorch、Transformer、RAG、NL2SQL、分布式训练
成长机会学术影响力
业务类型profit_center
工作生活
50较低
工作地点为上海/杭州,公司未提及弹性或远程,互联网大厂通常工作强度较大,WLB一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI+金融具有行业前景,解决信贷决策问题有一定社会意义,但主要服务于商业目标。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs