
蚂蚁集团
蚂蚁集团-大模型后训练专家-CPO线
蚂蚁集团-大模型后训练专家-CPO线
发布于 大约 3 小时前普通员工/个人贡献者
杭州市
中级经验
全职员工
仅现场办公
学历未注明
机器学习工程
后训练
大模型
强化学习
数据合成
样本构造
模型微调
Hr业务
AI 估算 · 40k–60k
大模型方向热门,技能稀缺,蚂蚁集团平台好,薪资有竞争力,参考市场行情。
职位详情
关于这个职位
该职位专注于大模型在HR业务场景的后训练与Agent自主学习,涉及样本构造、模型微调、效果迭代及自动badcase识别等环节,适合有大模型微调和强化学习经验的技术专家
最低要求
有2~5年的大模型后训练经验,专业不限(计算机/软工/数学等相关背景更易上手)
大模型相关经验,包括但不限于模型微调、强化学习等
对AI有朴素的热情,有AI信仰,愿意用AI重构业务场景
工作职责
负责HR业务场景的大模型后训练工作,包括:样本构造、模型微调、效果迭代等环节
负责HR业务场景的Agent自主学习工作,包括:自动识别badcase、自动归因、合成样本数据、动态构建评测集等
AI 洞察
优缺点分析
优点
- 大模型是当前最热门的技术方向,积累的经验在市场上极具竞争力,薪资待遇优厚
- 职位涉及后训练和Agent自主学习,属于前沿领域,能接触最新技术和研究方法
- HR业务场景复杂,数据多样性和噪音可能较大,需要较强的数据处理和模型调优能力
- Agent自主学习尚在探索阶段,问题定义和评价标准不够成熟,需要自主创新能力
- 适合有大模型微调经验、对AI应用有热情、愿意深入业务场景解决实际问题的技术人才
缺点 / 挑战
- 蚂蚁集团作为互联网巨头,提供丰富的业务场景和海量数据,技术挑战大,成长空间充足
- 后训练工作迭代频率高,对工程效率和实验管理能力有较高要求
角色解读
- 技术深度方向:从后训练专家晋升为技术Leader,负责更大规模的模型训练和优化策略
- 业务广度方向:深入HR业务场景,成为AI+HR复合型专家,横向推广至其他业务线
- 管理方向:带团队负责模型后训练与Agent系统,逐步晋升为团队负责人或技术总监
- 负责HR业务场景的大模型后训练,包括样本构造、模型微调和效果迭代,提升模型在特定场景下的表现
- 主导Agent自主学习系统的构建,实现自动识别badcase、自动归因和动态评测集生成,减少人工干预
- 持续优化后训练流程,探索强化学习等前沿技术在HR场景的应用,推动AI能力落地
- 扎实的大模型后训练经验,熟悉模型微调(如LoRA、全参数微调)和强化学习方法
- 具备数据处理能力,能够构造高质量训练样本和合成数据,理解数据对模型效果的影响
- 掌握Agent相关技术,了解自动推理、工具调用等机制,能设计自动归因和评测闭环
申请策略
- 面试前了解蚂蚁HR业务的特点(如招聘、绩效等),思考如何用大模型重构这些场景
- 准备一个完整的技术案例,从问题定义、数据构造、模型训练到效果评估,展示系统性思维
- 重点突出大模型后训练项目经验,包括微调方法、数据构造和效果提升的具体数据
- 展示强化学习、Agent相关项目经历,特别是自动badcase识别或闭环优化案例
- 强调技术热情和AI信仰,例如个人博客、开源贡献或在AI社区的活跃记录
- 补充强化学习(如RLHF、DPO)的系统知识,了解主流后训练工具(如DeepSpeed、Megatron)
- 学习Agent框架(如LangChain、AutoGPT)和评测方法论,构建端到端自动学习系统
面试指南
- 用STAR法则:背景(Situation)、任务(Task)、行动(Action)、结果(Result)结构化回答项目经验
- 对比不同方法的优劣:例如全参数微调 vs LoRA,RLHF vs DPO,展示技术判断力
- 结合业务场景:从HR数据特点出发,说明数据清洗、样本构造和评测指标的设计思路
- 请详细描述一个你做过的大模型后训练项目,包括数据来源、微调方法和效果提升
- 在HR业务场景中,你认为大模型后训练最大的挑战是什么?如何解决数据不均衡问题?
- 解释强化学习在后训练中的作用,你用过哪些RL算法?如何设计奖励模型?
- 如何设计一个Agent系统来自动识别和修复badcase?
- 复习大模型后训练经典方法(SFT、RLHF、DPO)和最新论文(如LIMA、QLoRA)
职位点评
75
综合评分
高成长、高薪资、前沿技术栈,但工作强度较大且灵活性有限。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿和职业成长,愿意接受一定工作强度的大模型从业者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活40
使命价值70
薪资福利
85较高
职位薪资竞争力强,蚂蚁集团福利完善,但JD未明确薪资范围,且未提具体福利。
薪资信号未披露(AI估算:40K-60K/月)
成长发展
90较高
大模型后训练是前沿技术,职位涉及强化学习和Agent等进阶方向,成长空间大。JD未明确提及晋升通道,但业务挑战性强。
技术前沿前沿/新兴技术
技术栈大模型、后训练、模型微调、强化学习、Agent、合成数据
业务类型ambiguous
工作生活
40较低
地点杭州,蚂蚁集团通常要求现场办公,未提及弹性或远程,工作强度可能较大。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
70中等
大模型应用于HR场景具有降本增效的社会价值,但行业承压不明显,创新程度属于积极采用新技术。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
微信-后台开发高级工程师-机器学习工程方向
腾讯 · 广州市AI 估算 · 25k-45k广告算法实习生
知乎 · 北京市AI 估算 · 4k-8k2026 Shanghai Machine Learning Modelling Engineer Internship, PhD
澳蒂华 · 上海市AI 估算 · 15k-25kSenior Machine Learning Engineer
澳蒂华 · 上海市AI 估算 · 40k-70kAI Application Development Intern
联想 · 中国台湾, Taipei City, 中山(Zhongshan)AI 估算 · 3k-5k
Watch Jobs