Alibaba logo
阿里巴巴
代码场景的Agentic RL与数据合成-阿里星

代码场景的Agentic RL与数据合成-阿里星

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 杭州市
无经验要求
全职员工
仅现场办公
博士
机器学习工程
Agentic Rl
Coding Agent
Dpo
Grpo
Llm
Ppo
强化学习
数据合成
机器学习

AI 估算 · 40k–70k

博士顶尖研究岗,Agentic RL前沿方向,阿里星高薪竞争力强,杭州/北京月薪4-7万。

职位详情

关于这个职位

这是阿里巴巴阿里星项目下的前沿研究岗位,聚焦代码场景的Agentic强化学习与数据合成

你将探索大模型在自主决策、规划与工具调用上的训练方法,优化RL算法,提升模型在代码任务中的表现,并有机会将成果发表于NeurIPS、ICLR等顶会
适合对LLM/RL/Agent方向有深入研究的博士

最低要求

计算机、信息科学、数学或相关专业博士学历,深入理解LLM/MLLM/RL/Agent领域,熟悉DPO/PPO/GRPO等RL前沿算法

有较强的自驱力、学习力、创新力、沟通能力和抗压能力,能够跟上正在快速变化的AI时代

工作职责

针对Agentic模型的训练特点,探索Agentic数据的合成策略与后训练数据配比策略,探索稳定高效的Agentic RL 方案,持续迭代模型在Agent场景的应用性能

应用并改进Agentic RL算法,提升模型在代码场景中的成功率和鲁棒性
将业务突破转化为学术成果,支持在 NeurIPS、ICLR、ICML 等顶会发表高质量论文,或推动相关算法在社区的开源,建立行业影响力

优先资格

有大规模数据合成、Coding Agent训练、大规模RL训练等项目经验者优先

加分项:在ICLR、ICML、CVPR、ICCV、ACL、NeurIPS等顶会上发表过高质量论文,有高质量github开源项目者优先
加分项:具有业界AI/Agent团队的相关实习和工作经验

AI 洞察

优缺点分析

优点

  • 研究方向为AI最前沿的Agentic RL,技术含金量高,未来发展空间大
  • 阿里巴巴和阿里星的平台资源丰富,数据、算力、人才支持到位
  • 鼓励学术发表,支持在NeurIPS等顶会建立知名度和行业影响力
  • 薪资待遇在业内顶尖,福利完善
  • 需同时兼顾业务落地和学术创新,时间精力投入大
  • 适合热爱AI研究、具有扎实数理基础和动手能力,渴望在无人区探索且能承受高压的博士

缺点 / 挑战

  • AI研究竞争激烈,需要持续产出高影响力成果,压力较大
  • Agentic RL算法尚不成熟,研究难度高,可能面临不确定性和失败风险

角色解读

  • 在阿里AI Lab或通义实验室深耕,成为领域专家
  • 通过发表顶会论文和开源项目提升学术影响力,晋升高级研究员或技术专家
  • 未来可转向技术管理或创业,成为AI领域的领军人物
  • 研究Agentic模型的训练方法,包括数据合成策略和后训练数据配比优化
  • 应用和改进PPO、GRPO等强化学习算法,提升模型在代码生成和工具调用中的成功率与鲁棒性
  • 将研究成果转化为学术论文或开源项目,建立行业影响力
  • 博士学历,深入理解LLM、RL、Agent等核心领域
  • 熟练使用DPO、PPO、GRPO等前沿强化学习算法
  • 具备大规模数据合成或Coding Agent训练的实际项目经验
  • 强大的编程能力和自驱力,能够快速迭代和验证新想法

申请策略

  • 了解阿里星计划的定位与培养方式,在面试中展示自己的学术潜力和影响力愿景
  • 关注阿里巴巴在Agent方向的产品(如通义千问的Agent功能),结合业务场景提出创新研究思路
  • 重点突出在LLM、RL、Agent方向的顶会论文或高质量study,尤其是ICLR/NeurIPS等
  • 展示实际的项目经验,如大规模数据合成、Coding Agent训练、RL训练框架搭建等
  • 强调GitHub开源项目和技术分享,体现工程和社区影响力
  • 提及在前沿算法(如DPO、PPO、GRPO)上的直接实践和调优经验
  • 强化对GRPO、DPO等最新RLHF算法的理解,并动手实现或复现相关论文
  • 学习Agentic框架(如LangChain、AutoGPT)和代码生成模型(如CodeLlama)的实践

面试指南

  • 从问题定义、方法设计、实验验证三个层次回答,先讲原理再结合自身实践经验
  • 针对算法对比问题,先梳理两者核心差别,再结合Agent场景的约束(如奖励延迟、动作空间)进行论述
  • 项目类问题遵循STAR法则,突出个人贡献、难点解决方案和可量化成果
  • 如何设计Agentic RL的训练流程?如何解决奖励稀疏问题?
  • 比较PPO与GRPO的异同,为什么GRPO在Agent场景更有效?
  • 请分享你在大模型数据合成方面的一个项目,如何保证数据质量?
  • 如何平衡强化学习中的探索与利用,提升模型的鲁棒性?
  • 你未来的研究规划是什么?如何将学术成果落地为产品价值?

职位点评

82
综合评分

顶尖AI研究岗,前沿Agentic RL技术栈,高薪高压,WLB未明确。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合以技术成长和学术成就为核心驱动力的博士人才,能接受高强度工作节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利90
成长发展95
工作生活50
使命价值80

薪资福利

90较高

阿里巴巴为上市公司,阿里星项目薪酬极具竞争力,福利体系完善,稳定性强。

薪资信号未披露(AI估算:40K-70K/月)

成长发展

95较高

该岗位处于AI最前沿的Agentic RL领域,技术成长空间极大,且公司鼓励发表论文和开源,职业发展路径清晰。

技术前沿前沿/新兴技术
技术栈LLM、RL、Agent、DPO、PPO、GRPO、数据合成、Coding Agent
业务类型ambiguous

工作生活

50较低

工作地点在北京/杭州科技园区,但JD未提及弹性工作或远程,阿里高强度工作文化可能导致WLB一般。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

80较高

Agentic RL是AI核心方向,研究将推动智能体技术发展,具有一定的社会价值与行业影响力。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs