
阿里巴巴
研究型实习生-Agent模型后训练-Accio Work
研究型实习生-Agent模型后训练-Accio Work
发布于 大约 2 小时前实习/见习
北京市 / 杭州市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Computer Use
Llm
Mcp
Rl
Sft
Cpt
AI 估算 · 0k–1k
实习岗位,日薪300-500元,基于大厂AI实习市场水平。
职位详情
关于这个职位
加入阿里巴巴Accio团队,深度参与Agent模型的后训练研发,包括CPT、SFT和RL阶段,专注于coding和computer use能力
你将参与构建大规模基准测试和在线强化学习框架,探索Agent与真实环境的交互,表现优秀者可在核心tech report中署名
适合对AI前沿技术充满热情、具备扎实工程能力的硕博在读学生
最低要求
深厚的技术背景:计算机、信息科学、数学或相关专业硕士/博士学位,业界AI/Agent团队的相关实习和工作经验
有较好工程能力,有Coding/Search Agent构建、Agent记忆系统构建、Multi-agent协作设计者优先
有较强的自驱力、学习力、创新力和抗压能力,能够跟上正在快速变化的AI时代
工作职责
核心模型演进:深度参与大规模Agentic LLM的全链路研发,涵盖Mid-train/CPT、SFT及RL阶段,探索领域知识增强与多任务学习的前沿技术,表现突出者可在核心tech report中署名
工程化与基准建设:参与构建代码库级别的Benchmark,优化模型在多语言、多框架环境下的跨模块调用与依赖分析性能
Black-box Agent RL & Online Learning:
a. 策略建模与优化:深入研究Black-box Reward/Value Function的建模,解决Agent在不可导环境反馈下的策略梯度估计问题
b. 持续探索架构:设计并实现高性能的Online RL框架,支持Agent在真实操作系统与开发环境中进行大规模并发探索与在线策略迭代
c. 长程推理研究:针对Long-horizon RL场景,攻克Credit Assignment(信用分配)难题,提升Agent在多步推理下的决策稳定性
Computer-Use Agent系统建设:
a. 全链路数据Scaling:参与构建海量真实用户交互数据的自动化生产流水线,覆盖办公场景与自动化流程,实现数据的高效回流与训练闭环
b. 数字任务执行核:开发基于Bash、Skills、MCP(Model Context Protocol)的执行引擎,构建能够熟练使用各种CLI工具与数字插件的Agent核心模型
c. 多场景交互闭环:探索Agent与真实操作系统、浏览器及专业开发环境的交互,在Terminal、MLE-bench等复杂基准测试中验证模型的端到端任务完成率
优先资格
加分项:在ICLR、CVPR、ICCV、ACL、NeurIPS等顶会上发表过高质量论文,有高质量github开源项目者优先
AI 洞察
优缺点分析
优点
- 团队实力强,成员来自顶尖大厂,有训练T级模型的经验,能学到前沿技术
- 工作内容前沿,涉及Agent、RL等热门方向,有论文发表机会,对职业发展有利
- 公司平台大,资源丰富,能接触真实业务场景和海量数据
- 工作强度大,需要适应快速迭代的研究节奏,抗压能力要求高
- 技术难度高,需要扎实的ML基础和工程能力,学习曲线陡峭
- 实习岗位竞争激烈,对学术背景和项目经验要求高
- 适合对AI Agent和强化学习有浓厚兴趣,具备扎实ML基础,希望在大厂积累前沿研究经验的硕博在读学生
缺点 / 挑战
暂无明显挑战项
角色解读
- 在团队中积累大规模模型训练经验,有机会在顶会发表论文,提升学术影响力
- 表现优秀者可获得转正机会,进入阿里核心AI团队,参与更前沿的模型研发
- 未来可向AI研究员、高级算法工程师等方向发展,成为Agent领域的专家
- 参与Agent模型的后训练全流程,包括CPT、SFT和RL阶段,优化模型在coding和computer use任务上的表现
- 构建代码库级别的Benchmark,评估模型在多语言、多框架环境下的性能
- 研究Black-box Agent RL,设计在线学习框架,解决策略梯度估计和信用分配问题
- 开发Computer-Use Agent系统,构建数据流水线和执行引擎,提升Agent在真实环境中的任务完成率
- 扎实的机器学习基础,熟悉LLM训练流程(预训练、微调、RLHF)
- 优秀的编程能力,精通Python,熟悉PyTorch等深度学习框架
- 了解Agent相关技术,如Coding Agent、记忆系统、Multi-agent协作
- 具备较强的自驱力和抗压能力,能适应快速迭代的研究环境
申请策略
- 在简历中明确表达对Agent方向的热情和长期规划
- 准备一个能体现你技术深度的项目案例,在面试中详细阐述
- 突出LLM训练相关项目经验,如参与过预训练、微调或RLHF项目
- 强调工程能力,如构建过Agent系统、使用过PyTorch等框架
- 展示学术成果,如顶会论文、开源项目,体现研究能力
- 提及相关实习经历,特别是AI或Agent方向的实践经验
- 系统学习强化学习算法,如PPO、DPO,了解RLHF流程
- 动手实践Agent项目,如使用LangChain构建简单Agent,了解MCP协议
面试指南
- 用STAR法则回答项目经历,突出技术难点和你的贡献
- 对于技术问题,先阐述原理,再结合实践经验,最后提出优化思路
- 展示学习能力,承认不足但提出快速学习计划
- 请介绍你参与过的LLM训练项目,你在其中负责什么?
- 如何设计一个Agent的强化学习奖励函数?
- 解释一下Credit Assignment问题,并说明如何解决?
- 你了解MCP协议吗?如何实现一个Computer-Use Agent?
- 面对模型训练不收敛,你会如何调试?
职位点评
74
综合评分
顶尖大厂Agent研究实习,技术前沿,发展空间大,但工作强度高。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
最适合追求技术成长和学术成就的求职者,愿意投入高强度工作以换取前沿经验。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展95
工作生活50
使命价值80
薪资福利
60中等
实习薪资处于市场中等水平,但公司福利完善,作为大厂实习经历对长期职业发展有增值作用。
薪资信号未披露(AI估算:0K-0K/月)
成长发展
95较高
该职位提供顶尖的研发平台,接触前沿技术,有论文署名机会,对技能成长和职业发展极为有利。
技术前沿前沿/新兴技术
技术栈LLM、RL、SFT、CPT、Agent、Online Learning
成长机会顶会论文发表、开源项目
业务类型profit_center
工作生活
50较低
实习岗位通常需要高强度投入,工作地点在北京或杭州,但未提及弹性工作安排。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
AI Agent是当前高速发展的领域,工作具有技术前沿性,对社会智能化有积极影响。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs