
蚂蚁集团
蚂蚁集团-百灵语言模型-算法工程师(Deep Research方向)-北京/杭州
蚂蚁集团-百灵语言模型-算法工程师(Deep Research方向)-北京/杭州
发布于 大约 8 小时前普通员工/个人贡献者
北京市 / 杭州市
中级经验
全职员工
仅现场办公
硕士
机器学习工程
Agi
Deep Research
Dpo
Grpo
Ppo
Pytorch
分布式训练
大语言模型
强化学习
AI 估算 · 25k–45k
大模型算法岗位稀缺,蚂蚁集团薪资竞争力强,硕士起薪较高,年终奖金丰厚。
职位详情
关于这个职位
该职位负责蚂蚁自研大语言模型的训练与优化,重点聚焦Deep Research方向的轨迹优化和智能体推理能力提升
你将参与从预训练到强化学习微调的全流程,探索前沿AGI技术,并与多团队协作推动算法落地
适合对LLM+RL有热情、追求技术极致的算法工程师
最低要求
计算机、人工智能、自动化、数学或相关专业硕士及以上学历
扎实的机器学习与深度学习基础,对强化学习算法理论有充分的了解
具备大模型与RL结合的实际项目经验,如pretrain、SFT、RLHF、DPO微调、智能体训练、模拟环境交互等
熟练掌握PyTorch等深度学习框架,熟悉常用大模型训练库
具备优秀的工程实现能力和问题拆解能力,能独立推进端到端算法落地
对AGI技术有热情,乐于探索前沿、拥抱不确定性
工作职责
● 参与蚂蚁自研大语言模型各阶段训练,包括但不限于pretrain、SFT、PPO、DPO、GRPO等
● 针对Deep Research类任务的轨迹优化等问题优化奖励建模、偏好学习及策略微调流程
● 探索大模型在复杂任务中的自主推理、工具调用与长期规划能力,结合RL提升智能体决策水平
● 与数据、工程、产品团队紧密协作,将算法成果高效集成到线上大模型服务中
● 跟踪并复现国际顶级会议在LLM领域的最新进展
优先资格
● 熟悉多模态大模型 + RL应用场景
● 有高质量开源项目、顶会论文或知名AI实验室研究经历
● 有分布式训练、大规模GPU集群调优经验
● 参与过对话系统、游戏AI、机器人决策等RL落地项目
AI 洞察
优缺点分析
优点
- 前沿技术方向:聚焦LLM+RL,处于AI研究最前沿,技能积累价值高
- 充足算力资源:蚂蚁集团提供丰富的GPU集群,支持大规模实验
- 顶级团队:与优秀同事合作,快速提升技术视野和工程能力
- 技术难度高:需要同时掌握深度学习、强化学习和大模型训练,学习曲线陡峭
- 竞争激烈:大模型领域人才济济,需要持续产出高质量成果
- 不确定性:AGI方向仍在探索,工作内容可能随研究进展快速调整
缺点 / 挑战
- 适合对LLM和强化学习有强烈兴趣,享受技术挑战,愿意在大模型前沿持续深耕的算法工程师
角色解读
- 从算法工程师成长为LLM/RL领域的专家,主导核心技术方向
- 晋升为技术负责人或架构师,带领团队攻克AGI相关难题
- 有机会发表顶会论文、参与开源项目,成为行业内知名研究者
- 参与大语言模型从预训练到强化学习微调的全阶段训练,如Pretrain、SFT、PPO等
- 针对Deep Research任务优化奖励建模和偏好学习,提升模型在复杂推理中的表现
- 探索模型自主推理、工具调用和长期规划能力,结合强化学习增强智能体决策水平
- 与数据、工程、产品团队协作,将算法成果集成到线上大模型服务中
- 扎实的机器学习与深度学习基础,深入理解强化学习算法理论(如PPO、DPO)
- 具备大模型与RL结合的实际项目经验,熟悉常用训练框架和PyTorch
- 优秀的工程实现和问题拆解能力,能独立推进端到端算法落地
- 对AGI技术有热情,乐于探索前沿和不确定性
申请策略
- 在简历和面试中展现对AGI的热情和独立思考,例如对当前LLM局限性的见解
- 提前了解蚂蚁百灵大模型的技术方向和团队成果,准备相关讨论
- 突出大模型训练或RL项目经验,如SFT、PPO、DPO等微调实践
- 强调顶会论文、知名AI实验室经历或高质量开源项目
- 展示分布式训练、大规模GPU集群调优等工程能力
- 提及对话系统、游戏AI、机器人决策等RL落地项目
- 系统学习强化学习理论,重点掌握PPO、DPO、GRPO等算法
- 熟悉主流大模型训练框架(如DeepSpeed、Megatron)和分布式训练技巧
面试指南
- 对于算法原理类问题,先阐述核心思想,再结合数学公式或伪代码具体说明,最后联系实际应用
- 对于项目经验类问题,采用STAR原则:背景、任务、行动、结果,重点突出你的贡献和反思
- 对于开放性问题,展示你的技术视野和批判性思维,提出有依据的改进方向
- 请详细解释RLHF的训练流程,包括PPO的具体实现和 reward model 的设计
- 你如何设计一个奖励函数来优化Deep Research任务的轨迹?
- 在大模型训练中遇到过哪些工程挑战?如何解决?
- 你如何看待当前LLM在自主推理和工具调用方面的局限性?有什么改进思路?
- 介绍一个你参与过的LLM+RL项目,从问题定义到最终效果
职位点评
70
综合评分
前沿大模型算法岗,技术成长极高,薪资中上,但工作强度未知且现场办公。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿、渴望快速成长、愿意在LLM+RL领域深耕的求职者,对WLB要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活40
使命价值75
薪资福利
70中等
薪资未在JD中明确,但蚂蚁集团薪资水平具有竞争力;提供充足算力资源,属于硬件福利,但基本福利如五险一金等未提及。
薪资信号未披露(AI估算:25K-45K/月)
福利待遇充足的算力资源
成长发展
90较高
该职位处于LLM+RL技术前沿,涉及多项先进算法和分布式训练,成长空间巨大;JD中强调跟踪顶会进展,但对内部晋升或培训未明确提及。
技术前沿前沿/新兴技术
技术栈大语言模型、强化学习、PPO、DPO、GRPO、PyTorch、分布式训练、AGI
业务类型profit_center
工作生活
40较低
JD未提及远程或弹性办公选项,工作地点为北京/杭州现场,且大模型算法岗通常工作强度较高,WLB信号缺失。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
大模型属于高速增长赛道,蚂蚁集团在该领域投入巨大,对社会有一定影响(如金融科技),但JD未强调社会使命,创新程度较高。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs