Ant Group logo
蚂蚁集团
蚂蚁集团-大模型算法工程师/专家-LLM后训练

蚂蚁集团-大模型算法工程师/专家-LLM后训练

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 杭州市
专家级经验
全职员工
仅现场办公
硕士
机器学习工程
Dpo
Grpo
Llm
Ppo
Pytorch
Rlhf
Sft
分布式训练
大语言模型

AI 估算 · 50k–80k

大厂大模型核心岗位,技术稀缺,薪资高位,含年终奖。

职位详情

关于这个职位

该职位负责大语言模型(LLM)的后训练全流程优化,包括SFT、RLHF、DPO等算法的实现与应用,提升模型的指令遵循、逻辑推理等能力

同时需要构建评估体系,参与开源与学术研究
适合对LLM训练有深入理解的技术专家

最低要求

● 计算机科学、人工智能、数学等相关专业硕士及以上学历(优秀本科生可放宽)

● 熟练掌握 Python 和 PyTorch,具备分布式训练(如多机多卡调优)经验
● 深入理解 Transformer 架构及SFT/RLHF/DPO/PPO/GRPO等算法
● 在NeurIPS、ICML、ICLR、 ACL等顶会发表论文,或 Kaggle、ACM 竞赛获奖者优先

工作职责

参与大语言模型(LLM)后训练全流程优化,包括但不限于通用能力提升、安全对齐等方向

实现并应用SFT/RLHF/DPO/PPO/GRPO等算法,探索多目标奖励模型、过程监督等前沿技术,提升模型在指令遵循、逻辑推理、多任务泛化等方面的性能
构建模型效果评估体系,设计自动化评估方案,持续跟踪模型优化效果
参与技术开源与学术研究,发表顶会论文或贡献核心开源项目

优先资格

● 具备大规模(千卡级)训练调优经验

● 大规模MoE架构训练/调优经验
● 长思维链/复杂任务推理经验
● 在开源社区(如 HuggingFace、GitHub)有突出贡献

AI 洞察

优缺点分析

优点

  • 蚂蚁集团大平台,资源丰富,业务场景多样
  • 主导大模型后训练核心方向,技术前沿,成长快
  • 鼓励学术发表和开源贡献,提升个人影响力
  • 薪资福利有竞争力,大厂稳定性高
  • 技术迭代快,需要持续学习保持前沿
  • 竞争激烈,对学术产出和工程能力要求高
  • 适合对LLM训练有深厚积累、热爱技术研究、能承受高强度工作的算法工程师或专家

缺点 / 挑战

  • 大模型训练算力需求大,工作强度可能较高

角色解读

  • 从算法工程师向技术专家或架构师发展,主导大模型训练方向
  • 有机会晋升为团队技术leader,管理算法团队
  • 通过开源和学术影响力,成为行业知名专家
  • 负责LLM后训练全流程,包括SFT、RLHF等对齐技术,提升模型性能
  • 设计并实现多目标奖励模型、过程监督等前沿算法
  • 构建模型评估体系,确保模型效果持续优化
  • 参与开源项目和技术论文,推动领域进展
  • 精通Python和PyTorch,具备分布式训练调优能力
  • 深入理解Transformer及主流对齐算法(SFT/RLHF/DPO等)
  • 有大规模训练经验,熟悉模型并行和数据并行策略
  • 学术能力强,有顶会论文或竞赛获奖经历

申请策略

  • 提前了解蚂蚁集团的大模型布局和技术栈
  • 准备能体现深度技术理解的项目案例
  • 突出大模型训练项目经验,包括模型规模、数据量、具体对齐技术
  • 展示论文发表或竞赛获奖,体现学术能力
  • 强调分布式训练调优经验,如多机多卡、千卡级训练
  • 提供开源贡献链接,如GitHub或HuggingFace
  • 熟悉GRPO、过程监督等最新对齐算法
  • 了解MoE架构和长推理链技术

面试指南

  • 对于技术问题,采用STAR法则:情境、任务、行动、结果,突出具体细节和量化指标
  • 对于算法比较题,从原理、实现复杂度、效果、优缺点等维度对比分析
  • 对于开放性设计问题,先需求分析,再提出方案,并说明权衡
  • 请详细介绍你参与过的LLM后训练项目,包括算法选择、调优过程
  • 解释RLHF和DPO的区别及适用场景
  • 如何设计奖励模型来平衡多个目标?
  • 大规模训练中遇到的主要挑战及解决方案?
  • 如何看待大模型安全对齐的重要性?

职位点评

80
综合评分

大厂大模型核心岗位,薪资丰厚,技术前沿,但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和高薪酬、能适应高强度工作的算法人才。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活50
使命价值80

薪资福利

85较高

该职位薪资水平高,福利完善,稳定性强,能满足补偿性动机。

薪资信号未披露(AI估算:50K-80K/月)

成长发展

95较高

参与大模型后训练前沿算法,有大量学习和成长机会,鼓励学术产出。

技术前沿前沿/新兴技术
技术栈LLM、SFT、RLHF、DPO、PPO、GRPO、PyTorch、Transformer
业务类型ambiguous

工作生活

50较低

工作地点在北京或杭州,需现场办公,未明确弹性工作,大厂节奏可能较紧张。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

大模型技术有广泛社会影响,推动AI发展,但JD未突出社会价值。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs