
阿里巴巴
研究型实习生-1688-Agentic AI/RL实习生
研究型实习生-1688-Agentic AI/RL实习生
发布于 大约 2 小时前实习/见习
杭州市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Cpt
Dpo
Grpo
Llm
Multi-Agent
Ppo
Rl
Sft
AI 估算 · 0k–1k
研究型实习生岗位,薪资按日薪计算,阿里实习日薪在300-500元区间,考虑到岗位对前沿技术的高要求,取中位数400元/天。
职位详情
关于这个职位
这是一个在阿里巴巴1688事业部的研究型实习生岗位,专注于大模型Agentic AI和强化学习(RL)领域
你将参与千亿级模型的Agent能力全流程优化,包括环境工具建设、数据合成、Reward Modeling以及Post-training算法(如GRPO/PPO)的攻坚
适合对LLM/RL/Agent有深入理解、热爱前沿技术研究、具备优秀自驱力的硕士或博士在读学生
最低要求
深入理解 LLM/RL/Agent 领域知识,熟悉常见的 Alignment 算法(如 DPO/PPO/GRPO/DAPO 等)
熟悉前沿 Agentic RL 算法与框架,参与过实际项目的开发与训练,具备敏锐的技术视野,对前沿研究保持敏感
对 AI 技术充满热情,具备优秀的自驱力(Self-driven)和复杂问题解决能力
工作职责
Agent 基础设施优化:在电商垂域开展大模型 Agentic AI 的关键要素构建与优化,涵盖环境工具建设(Environment/Tools)、高质量数据合成及 Reward Modeling
后训练算法攻坚:优化 Post-training 算法(如 GRPO/PPO/SearchR1 等),提升模型在复杂环境下的工具使用(Tool-use)、规划(Plan)、深度推理(Deep Research)及报告生成能力
全流程模型迭代:参与千亿级模型的 Agentic 能力全流程优化,包括 CPT (Continued Pre-training)、SFT、Post-train 及 Multi-agent RL,负责复现业界前沿工作并探索提出新算法
优先资格
拥有编程竞赛获奖经历、顶会论文发表记录或知名开源库贡献者优先
AI 洞察
优缺点分析
优点
- 平台优势:阿里巴巴是行业巨头,提供丰富的算力资源和真实业务场景,能接触到最前沿的AI技术
- 技术深度:专注于Agentic AI和RL这一前沿领域,能深入参与千亿级模型的训练和优化,技术成长快
- 团队实力:与顶尖的算法工程师和研究员共事,能快速提升自己的技术视野和问题解决能力
- 技术门槛高:需要扎实的LLM/RL理论基础和实际项目经验,对自驱力和学习能力要求极高
- 适合对LLM/RL/Agent有浓厚兴趣,具备扎实基础和强自驱力,希望在工业界前沿技术领域深耕的硕士或博士在读学生
缺点 / 挑战
- 工作强度大:研究型岗位通常需要投入大量时间进行实验和调优,可能面临较大的工作压力
角色解读
- 在阿里这样的大平台,可以接触千亿级模型的真实业务场景,积累宝贵的工业级经验
- 表现优秀者有机会转正,进入阿里核心AI团队,成为大模型应用领域的专家
- 未来可向高级算法工程师、研究科学家或技术管理方向发展
- 参与构建和优化电商场景下的大模型Agent基础设施,包括环境工具、数据合成和奖励模型
- 攻坚后训练算法,如GRPO、PPO等,提升模型在复杂任务中的工具使用、规划和深度推理能力
- 参与千亿级模型的全流程迭代,包括CPT、SFT、Post-train和Multi-agent RL,并复现和探索新算法
- 深入理解LLM、RL和Agent领域知识,熟悉常见的对齐算法(如DPO/PPO/GRPO)
- 熟悉前沿Agentic RL算法与框架,有实际项目开发或训练经验
- 具备优秀的自驱力、复杂问题解决能力和对前沿技术的敏锐度
申请策略
- 在申请材料中,明确表达你对Agentic AI和RL领域的热情和长期兴趣
- 可以提前了解1688的业务场景,思考如何将Agent技术应用到电商领域
- 突出在LLM/RL/Agent领域的项目经历,特别是涉及DPO/PPO/GRPO等算法的实际应用
- 强调编程竞赛获奖、顶会论文或开源贡献,这是重要的加分项
- 展示对前沿技术的热情和自驱力,例如个人博客、GitHub项目或技术分享
- 提前熟悉GRPO、PPO等后训练算法的原理和实现,并尝试在小型模型上复现
- 了解Agentic AI的常用框架(如LangChain、AutoGPT)和工具,并动手实践
- 提升Python编程能力,特别是PyTorch等深度学习框架的使用
面试指南
- 对于算法原理问题,建议从数学公式、直觉理解和实际应用三个层面进行阐述
- 对于项目经验问题,采用STAR法则(情境、任务、行动、结果)来清晰描述
- 对于开放性问题,可以结合行业趋势和个人见解,展现思考深度
- 请详细解释GRPO和PPO算法的原理和区别?
- 你如何设计一个奖励模型(Reward Model)来评估Agent在电商场景中的表现?
- 请描述一个你参与过的RL项目,你在其中扮演的角色和遇到的挑战?
- 如何解决大模型在复杂环境中的工具使用和规划问题?
- 你对Agentic AI的未来发展趋势有何看法?
职位点评
66
综合评分
前沿技术、顶级平台、成长空间大,但工作强度高、生活平衡度低。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
该职位最适合追求技术成长和前沿研究,对Agentic AI和RL有浓厚兴趣,并愿意投入大量时间进行深入研究的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展95
工作生活40
使命价值70
薪资福利
60中等
实习薪资在行业中属于中等偏上水平,但作为实习岗位,整体薪酬吸引力有限。
薪资信号未披露(AI估算:0K-0K/月)
成长发展
95较高
该岗位处于AI最前沿的Agentic和RL领域,技术挑战大,成长空间极高,能接触到千亿级模型训练,对个人技能提升有巨大帮助。
技术前沿前沿/新兴技术
技术栈LLM、RL、Agent、GRPO、PPO、DPO、SFT、CPT
业务类型profit_center
工作生活
40较低
实习岗位通常需要投入大量时间进行研究和实验,工作强度较大,工作地点固定,生活化程度较低。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
70中等
该岗位处于AI技术前沿,对推动人工智能在电商领域的应用有直接贡献,行业前景广阔,但社会影响力相对中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs