
阿里巴巴
代码场景的Agentic RL与数据合成-阿里星
代码场景的Agentic RL与数据合成-阿里星
发布于 大约 14 小时前普通员工/个人贡献者
北京市 / 杭州市
无经验要求
全职员工
仅现场办公
博士
机器学习工程
Agentic Rl
Coding Agent
Dpo
Grpo
Llm
Ppo
强化学习
数据合成
机器学习
AI 估算 · 40k–70k
博士顶尖研究岗,Agentic RL前沿方向,阿里星高薪竞争力强,杭州/北京月薪4-7万。
职位详情
关于这个职位
这是阿里巴巴阿里星项目下的前沿研究岗位,聚焦代码场景的Agentic强化学习与数据合成
你将探索大模型在自主决策、规划与工具调用上的训练方法,优化RL算法,提升模型在代码任务中的表现,并有机会将成果发表于NeurIPS、ICLR等顶会
适合对LLM/RL/Agent方向有深入研究的博士
最低要求
计算机、信息科学、数学或相关专业博士学历,深入理解LLM/MLLM/RL/Agent领域,熟悉DPO/PPO/GRPO等RL前沿算法
有较强的自驱力、学习力、创新力、沟通能力和抗压能力,能够跟上正在快速变化的AI时代
工作职责
针对Agentic模型的训练特点,探索Agentic数据的合成策略与后训练数据配比策略,探索稳定高效的Agentic RL 方案,持续迭代模型在Agent场景的应用性能
应用并改进Agentic RL算法,提升模型在代码场景中的成功率和鲁棒性
将业务突破转化为学术成果,支持在 NeurIPS、ICLR、ICML 等顶会发表高质量论文,或推动相关算法在社区的开源,建立行业影响力
优先资格
有大规模数据合成、Coding Agent训练、大规模RL训练等项目经验者优先
加分项:在ICLR、ICML、CVPR、ICCV、ACL、NeurIPS等顶会上发表过高质量论文,有高质量github开源项目者优先
加分项:具有业界AI/Agent团队的相关实习和工作经验
AI 洞察
优缺点分析
优点
- 研究方向为AI最前沿的Agentic RL,技术含金量高,未来发展空间大
- 阿里巴巴和阿里星的平台资源丰富,数据、算力、人才支持到位
- 鼓励学术发表,支持在NeurIPS等顶会建立知名度和行业影响力
- 薪资待遇在业内顶尖,福利完善
- 需同时兼顾业务落地和学术创新,时间精力投入大
- 适合热爱AI研究、具有扎实数理基础和动手能力,渴望在无人区探索且能承受高压的博士
缺点 / 挑战
- AI研究竞争激烈,需要持续产出高影响力成果,压力较大
- Agentic RL算法尚不成熟,研究难度高,可能面临不确定性和失败风险
角色解读
- 在阿里AI Lab或通义实验室深耕,成为领域专家
- 通过发表顶会论文和开源项目提升学术影响力,晋升高级研究员或技术专家
- 未来可转向技术管理或创业,成为AI领域的领军人物
- 研究Agentic模型的训练方法,包括数据合成策略和后训练数据配比优化
- 应用和改进PPO、GRPO等强化学习算法,提升模型在代码生成和工具调用中的成功率与鲁棒性
- 将研究成果转化为学术论文或开源项目,建立行业影响力
- 博士学历,深入理解LLM、RL、Agent等核心领域
- 熟练使用DPO、PPO、GRPO等前沿强化学习算法
- 具备大规模数据合成或Coding Agent训练的实际项目经验
- 强大的编程能力和自驱力,能够快速迭代和验证新想法
申请策略
- 了解阿里星计划的定位与培养方式,在面试中展示自己的学术潜力和影响力愿景
- 关注阿里巴巴在Agent方向的产品(如通义千问的Agent功能),结合业务场景提出创新研究思路
- 重点突出在LLM、RL、Agent方向的顶会论文或高质量study,尤其是ICLR/NeurIPS等
- 展示实际的项目经验,如大规模数据合成、Coding Agent训练、RL训练框架搭建等
- 强调GitHub开源项目和技术分享,体现工程和社区影响力
- 提及在前沿算法(如DPO、PPO、GRPO)上的直接实践和调优经验
- 强化对GRPO、DPO等最新RLHF算法的理解,并动手实现或复现相关论文
- 学习Agentic框架(如LangChain、AutoGPT)和代码生成模型(如CodeLlama)的实践
面试指南
- 从问题定义、方法设计、实验验证三个层次回答,先讲原理再结合自身实践经验
- 针对算法对比问题,先梳理两者核心差别,再结合Agent场景的约束(如奖励延迟、动作空间)进行论述
- 项目类问题遵循STAR法则,突出个人贡献、难点解决方案和可量化成果
- 如何设计Agentic RL的训练流程?如何解决奖励稀疏问题?
- 比较PPO与GRPO的异同,为什么GRPO在Agent场景更有效?
- 请分享你在大模型数据合成方面的一个项目,如何保证数据质量?
- 如何平衡强化学习中的探索与利用,提升模型的鲁棒性?
- 你未来的研究规划是什么?如何将学术成果落地为产品价值?
职位点评
82
综合评分
顶尖AI研究岗,前沿Agentic RL技术栈,高薪高压,WLB未明确。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
最适合以技术成长和学术成就为核心驱动力的博士人才,能接受高强度工作节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利90
成长发展95
工作生活50
使命价值80
薪资福利
90较高
阿里巴巴为上市公司,阿里星项目薪酬极具竞争力,福利体系完善,稳定性强。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
95较高
该岗位处于AI最前沿的Agentic RL领域,技术成长空间极大,且公司鼓励发表论文和开源,职业发展路径清晰。
技术前沿前沿/新兴技术
技术栈LLM、RL、Agent、DPO、PPO、GRPO、数据合成、Coding Agent
业务类型ambiguous
工作生活
50较低
工作地点在北京/杭州科技园区,但JD未提及弹性工作或远程,阿里高强度工作文化可能导致WLB一般。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
80较高
Agentic RL是AI核心方向,研究将推动智能体技术发展,具有一定的社会价值与行业影响力。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs