Alibaba logo
阿里巴巴
研究型实习生-Agentic RL-Accio

研究型实习生-Agentic RL-Accio

发布于 大约 14 小时前

实习/见习

杭州市
其它
实习生
仅现场办公
硕士
机器学习工程
Agentic Rl
Pytorch
Verl
分布式训练
多智能体
大模型
强化学习

AI 估算 · 8k–15k

阿里研究型实习生薪酬在业内处于中上水平,加上前沿方向,预估月薪在8000-15000元。

职位详情

关于这个职位

这是阿里巴巴国际AI Native跨境贸易平台Accio的研究型实习生岗位,专注于Agentic RL(智能体强化学习)方向,面向异步长程B2B贸易场景构建Agent核心能力

你将参与大规模模型训练、奖励建模、评测体系搭建等研究工作,成果可直接落地真实业务并发表顶会论文

最低要求

11月及之后毕业,硕士及以上学历,计算机、人工智能、信息科学、数学、软件工程等相关专业

具有研究经验:大模型 post-training / 强化学习方向,具有一篇及以上一作顶会论文(NeurIPS / ICML / ICLR / ACL 等)
理解Agent系统:熟悉 Agent 系统设计,对 tool use、multi-step reasoning、skills 等能力有深入理解
具备工程能力:熟练使用 Python / PyTorch,熟悉主流 RL 训练框架(VeRL 等)及 Agent 开发框架

工作职责

Agentic RL 研究与训练: 设计面向异步长程场景的 RL 方案,包括合成数据构造、奖励建模与模型训练,利用分布式框架(VeRL 等)进行大规模调优

核心能力建设:研究长程任务分解、执行监控、自主纠偏、主动通知等 Agent 关键能力,推动成果在 Accio 业务场景落地
评测体系构建:搭建面向长程异步任务的评测基准,覆盖任务时间跨度、多轮交互、并发协调等现有 benchmark 未充分涵盖的维度

优先资格

有长程规划、异步任务调度、multi-agent 系统方向的研究发表

参与过知名 Agentic RL 项目
具备跨境电商或 B2B 贸易场景经验

AI 洞察

优缺点分析

优点

  • 研究前沿Agentic RL方向,有充足的计算资源(H100/B200集群)和真实商业场景,研究能直接落地
  • 阿里国际的平台提供丰富的业务数据,对研究有极大助力
  • 团队氛围开放包容,重视学术产出,适合追求科研突破的同学
  • 异步长程任务的研究难度大,需要较强的自我驱动和问题拆解能力
  • 适合对大模型强化学习有深入积累、对Agent方向有强烈兴趣,并希望在工业界做出前沿研究成果的博士或优秀硕士在读生

缺点 / 挑战

  • 实习岗位竞争激烈,要求顶会论文,门槛较高
  • 可能面临学术研究与业务落地的平衡压力,需要同时兼顾论文和工程效果

角色解读

  • 作为研究实习生,有机会在阿里巴巴的丰富场景和算力支持下,做出有影响力的研究成果并发表顶会论文
  • 表现优秀者有机会转正为正式研究员,继续深耕Agentic RL方向
  • 积累大规模分布式训练经验和B2B行业知识,未来可成为AI Agent领域的技术专家
  • 设计并训练Agentic RL模型,针对异步长程任务进行强化学习,包括合成数据构造、奖励建模和分布式训练
  • 研究长程任务分解、执行监控、自主纠偏等Agent关键能力,并将成果应用到Accio的实际业务中
  • 搭建面向长程异步任务的评测基准,覆盖多轮交互、并发协调等维度,推动研究落地
  • 扎实的机器学习基础,尤其熟悉大模型强化学习(RLHF、PPO等),有相关顶会论文发表
  • 熟练使用Python和PyTorch,能够使用VeRL等分布式RL训练框架进行大规模训练
  • 对Agent系统有深入理解,熟悉tool use、multi-step reasoning、skills等概念

申请策略

  • 可以提前了解阿里国际Accio的业务模式,在面试中结合自己的研究提出应用思路
  • 建议在简历中明确写清楚自己的研究方向与岗位的匹配点,突出对长程规划的兴趣
  • 突出自己的顶会论文,特别是与强化学习、大模型、Agent相关的成果,说明研究贡献
  • 强调工程能力,附上GitHub项目或开源贡献,展示Python/PyTorch和分布式训练经验
  • 体现对Agent系统的理解,可以描述之前做过的Agent项目或相关实现
  • 熟悉VeRL或类似分布式RL框架,可以自己尝试跑通一个RL训练流程
  • 学习异步长程Agent的经典工作,比如ReAct、Reflexion、AutoGPT等,理解其设计思路
  • 提升代码能力,尤其是并行训练、模型部署等方向

面试指南

  • 对于论文介绍,按照背景-问题-方法-实验-结论的STAR结构清晰阐述
  • 对于技术理解题,先给出定义,再对比传统方法,最后结合具体场景举例
  • 对于设计题,先拆解问题,提出关键挑战,然后给出解决方案,并考虑可行性和约束
  • 请介绍你的一篇顶会论文,具体贡献是什么?如何设计实验?
  • 你如何理解Agentic RL?它与传统的RL有什么不同?
  • 如果让设计一个异步长程任务的奖励模型,你会怎么做?
  • 你在训练大模型时遇到过哪些问题?如何解决?
  • 你对Accio业务场景有什么了解?你认为Agent可以怎么改进B2B流程?

职位点评

76
综合评分

阿里国际前沿Agentic RL研究实习,技术影响力大,但薪资未明说且竞争激烈。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
该职位最适合以技能成长和学术发展为优先目标的求职者,追求前沿技术挑战和科研产出。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利60
成长发展90
工作生活65
使命价值75

薪资福利

60中等

实习薪资在行业内有竞争力,但未披露具体数字,且实习岗位稳定性较低,福利有限。

薪资信号未披露(AI估算:8K-15K/月)

成长发展

90较高

该岗位处于AI前沿领域,提供大规模算力和真实商业场景,对技能成长和学术发展有极大帮助,但未明确晋升路径。

技术前沿前沿/新兴技术
技术栈Agentic RL、强化学习、大模型、Python、PyTorch、VeRL
业务类型ambiguous

工作生活

65中等

工作地点在杭州,需现场办公,未提及弹性或远程,WLB信息不明确,但杭州生活便利性较好。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

岗位以AI重构B2B采购体验为使命,行业处于高速增长期,但更偏向商业价值,社会影响力一般。

行业发展高速增长赛道
社会影响中性/一般
使命信号重构全球B2B采购体验
创新程度积极采用新技术
Watch Jobs