
阿里巴巴
阿里国际站/Alibaba.com-Agentic Post-Training算法工程师/专家-Accio Work
阿里国际站/Alibaba.com-Agentic Post-Training算法工程师/专家-Accio Work
发布于 大约 15 小时前普通员工/个人贡献者
杭州市
初级经验
全职员工
仅现场办公
硕士
机器学习工程
Llm
Post-Training
Rl
Tool-Use
数据合成
Multi-Step Reasoning
Verl/Slime
AI 估算 · 35k–65k
大厂AI核心岗位,前沿技术溢价高,杭州薪资略低于一线但综合年薪可观。
职位详情
关于这个职位
这是阿里巴巴国际站内部孵化产品Accio的Agentic Post-Training算法工程师岗位,聚焦Agent、LLM、RL等前沿技术
你将负责构建合成数据管线、搭建Agent交互环境、改进RL算法,并推动Agent技术在B2B跨境贸易中的落地
适合有扎实算法功底、对Agent方向充满热情、渴望在大平台做前沿研究的工程师
最低要求
硕士及以上学历,计算机、电子、人工智能、自动化、数学、物理、等相关专业优先
具有大规模数据合成、Coding Agent、Search Agent、大规模RL训练、商业场景Agent架构与环境构建项目经验者优先
具有良好的工程能力,熟悉Verl/Slime/RL2等模型训练infra并有训练经验者优先
熟悉LLM-based Chatbot技术原理者优先
熟悉LLM Post-Training训练数据构建方法,以及Multi-Agent系统框架者优先
有较强的自驱力、学习力、创新力和抗压能力,能够跟上正在快速变化的AI时代
工作职责
构建Agent专用合成数据管线:设计并实现自动化的合成数据方案,重点生产高质量的思维链、工具调用和自我修正轨迹
Agent交互环境搭建:构建高性能、可扩展的Agent框架和运行环境(如代码执行器、浏览器模拟器、数据库交互等),为模型提供实时反馈的环境
Agentic RL:应用并改进RL算法,提升模型在长程任务(Long-horizon tasks)中的成功率和鲁棒性
评估体系建设:开发超越传统基准测试的动态评估方案,针对规划能力、工具选择准确率、幻觉控制及错误恢复能力建立量化指标
探索落地前沿Agent技术,包含而不限于:Agentic Model、Agentic Benchmark、Agentic RL、Pro-active Agent、Function Calling、Tool-Use、Multi-Step Reasoning、Agent Harness、Agentic Post-Training
优先资格
具有扎实的机器学习基础,熟悉CV、NLP、RL、ML、多模态理解、搜推广等领域的技术,在ICML、ACL、EMNLP、CVPR、ECCV、ICCV、NeurIPS、ICLR、KDD、WWW、SIGIR、Recsys、SIGGRAPH或SIGGRAPH Asia等顶级会议/期刊上发表论文者优先
在具有影响力AI/Agent项目实习/工作经验者优先
在GitHub等开源社区具有影响力项目发表经验者优先
具有SOTA Agent产品核心算法开发/优化、大模型基座应用落地经验者优先
具有优秀的代码能力,熟练掌握C/C++或Python,在ACM/ICPC、NOI/IOl、Top Coder、Kaggle等比赛获奖者优先
在LLM、多模态、RL、基础模型、世界模型等领域,主导过大影响力项目者优先
AI 洞察
优缺点分析
优点
- 全球首个B2B AI Search Agent,技术方向极具前沿性和创新性
- 阿里巴巴大平台,资源丰富,产品有战略级重视,影响力大
- 涉及Agent、RL、LLM等多个热门方向,个人成长空间巨大
- 内部孵化项目,氛围相对创业,有机会深度参与产品定义
- 技术难度大,涉及数据合成、RL训练、系统搭建等多项复杂工程
- 对自驱力和创新能力要求高,需要独立解决前沿问题
- 适合有扎实算法基础、对Agent和强化学习充满热情、抗压能力强、希望在高平台做前沿研究的技术人才
缺点 / 挑战
- 工作强度可能较高,节奏快,需要持续学习和快速迭代
角色解读
- 成为Agent方向的算法专家,主导核心模型训练与优化,输出高水平论文或产品
- 向技术管理方向发展,带领团队探索Agent前沿技术并推动业务落地
- 延伸到多模态、世界模型等更广阔的AI方向,保持技术领先性
- 构建Agent专用合成数据管线,生产高质量思维链和工具调用轨迹,支撑模型训练
- 搭建Agent交互环境,如代码执行器、浏览器模拟器,为模型提供实时反馈
- 应用并改进强化学习算法,提升Agent在长程任务中的成功率和鲁棒性
- 开发动态评估方案,量化规划能力、工具选择准确率等Agent关键指标
- 扎实的机器学习与深度学习基础,熟悉LLM原理及Post-Training技术
- 熟悉强化学习算法及训练基础设施(如Verl/Slime),有分布式训练经验
- 良好的工程能力,熟练使用Python,能够构建Agent运行环境
- 了解Agent系统架构,如Function Calling、Tool-Use、Multi-Agent框架
申请策略
- 了解Accio产品定位和技术栈,准备有见地的分析和想法
- 展示对AI Agent未来发展的思考和热情,突出学习能力和创新潜质
- 突出大规模数据合成、Coding Agent或Search Agent相关项目经验
- 强调对LLM、RL、Agent的理解,如有顶会论文或高影响力开源项目更好
- 展示工程能力,如使用Verl/Slime等训练框架的经验,并给出具体成果
- 如果有Agent产品落地经验,详细描述你的角色和贡献
- 深入学习RLHF、RLVR等Post-Training技术,了解最新论文
- 熟悉LangChain、AutoGPT等Agent框架,动手实践构建Agent应用
面试指南
- 回答问题采用STAR法则:先说背景(Situation)、任务(Task),再讲你采取的行动(Action),最后强调结果(Result)并量化
- 对于技术概念题,先给出定义,再解释关键点,最后联系实际案例
- 如果遇到不确定的问题,诚实表达并展示思考过程
- 请谈谈你对Agentic Post-Training的理解,与传统Post-Training有何不同?
- 如何设计合成数据管线来生成高质量的思维链数据?
- 在RL训练中,如何处理长程任务的稀疏奖励问题?
- 你如何评估一个Agent的规划能力和工具选择能力?
- 请介绍一个你使用RL训练大规模模型的经历和结果
职位点评
71
综合评分
大厂AI前沿Agent岗位,技术成长极强,薪资有竞争力,但工作强度大,WLB不确定。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求前沿技术、渴望快速成长的算法工程师,能接受一定的加班强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值80
薪资福利
70中等
阿里巴巴薪资在行业内具有竞争力,但JD未明确具体范围,综合平台和岗位级别,薪酬保障较好。
薪资信号未披露(AI估算:35K-65K/月)
成长发展
85较高
岗位处于AI前沿技术领域,涉及Agent、LLM、RL等多方向,技术成长空间巨大,但未明确晋升机制。
技术前沿前沿/新兴技术
技术栈Agent、LLM、RL、Post-Training、Verl/Slime
业务类型ambiguous
工作生活
50较低
JD未提及工作生活平衡相关福利,工作地点为科技园,通常需现场办公,可能加班较多。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
80较高
产品是全球首个B2B AI Search Agent,具有行业首创性,对跨境贸易有变革意义,使命感和创新价值强。
行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs