Alibaba logo
阿里巴巴
阿里国际站/Alibaba.com-Agentic Post-Training算法工程师/专家-Accio Work

阿里国际站/Alibaba.com-Agentic Post-Training算法工程师/专家-Accio Work

发布于 大约 15 小时前

普通员工/个人贡献者

杭州市
初级经验
全职员工
仅现场办公
硕士
机器学习工程
Llm
Post-Training
Rl
Tool-Use
数据合成
Multi-Step Reasoning
Verl/Slime

AI 估算 · 35k–65k

大厂AI核心岗位,前沿技术溢价高,杭州薪资略低于一线但综合年薪可观。

职位详情

关于这个职位

这是阿里巴巴国际站内部孵化产品Accio的Agentic Post-Training算法工程师岗位,聚焦Agent、LLM、RL等前沿技术

你将负责构建合成数据管线、搭建Agent交互环境、改进RL算法,并推动Agent技术在B2B跨境贸易中的落地
适合有扎实算法功底、对Agent方向充满热情、渴望在大平台做前沿研究的工程师

最低要求

硕士及以上学历,计算机、电子、人工智能、自动化、数学、物理、等相关专业优先

具有大规模数据合成、Coding Agent、Search Agent、大规模RL训练、商业场景Agent架构与环境构建项目经验者优先
具有良好的工程能力,熟悉Verl/Slime/RL2等模型训练infra并有训练经验者优先
熟悉LLM-based Chatbot技术原理者优先
熟悉LLM Post-Training训练数据构建方法,以及Multi-Agent系统框架者优先
有较强的自驱力、学习力、创新力和抗压能力,能够跟上正在快速变化的AI时代

工作职责

构建Agent专用合成数据管线:设计并实现自动化的合成数据方案,重点生产高质量的思维链、工具调用和自我修正轨迹

Agent交互环境搭建:构建高性能、可扩展的Agent框架和运行环境(如代码执行器、浏览器模拟器、数据库交互等),为模型提供实时反馈的环境
Agentic RL:应用并改进RL算法,提升模型在长程任务(Long-horizon tasks)中的成功率和鲁棒性
评估体系建设:开发超越传统基准测试的动态评估方案,针对规划能力、工具选择准确率、幻觉控制及错误恢复能力建立量化指标
探索落地前沿Agent技术,包含而不限于:Agentic Model、Agentic Benchmark、Agentic RL、Pro-active Agent、Function Calling、Tool-Use、Multi-Step Reasoning、Agent Harness、Agentic Post-Training

优先资格

具有扎实的机器学习基础,熟悉CV、NLP、RL、ML、多模态理解、搜推广等领域的技术,在ICML、ACL、EMNLP、CVPR、ECCV、ICCV、NeurIPS、ICLR、KDD、WWW、SIGIR、Recsys、SIGGRAPH或SIGGRAPH Asia等顶级会议/期刊上发表论文者优先

在具有影响力AI/Agent项目实习/工作经验者优先
在GitHub等开源社区具有影响力项目发表经验者优先
具有SOTA Agent产品核心算法开发/优化、大模型基座应用落地经验者优先
具有优秀的代码能力,熟练掌握C/C++或Python,在ACM/ICPC、NOI/IOl、Top Coder、Kaggle等比赛获奖者优先
在LLM、多模态、RL、基础模型、世界模型等领域,主导过大影响力项目者优先

AI 洞察

优缺点分析

优点

  • 全球首个B2B AI Search Agent,技术方向极具前沿性和创新性
  • 阿里巴巴大平台,资源丰富,产品有战略级重视,影响力大
  • 涉及Agent、RL、LLM等多个热门方向,个人成长空间巨大
  • 内部孵化项目,氛围相对创业,有机会深度参与产品定义
  • 技术难度大,涉及数据合成、RL训练、系统搭建等多项复杂工程
  • 对自驱力和创新能力要求高,需要独立解决前沿问题
  • 适合有扎实算法基础、对Agent和强化学习充满热情、抗压能力强、希望在高平台做前沿研究的技术人才

缺点 / 挑战

  • 工作强度可能较高,节奏快,需要持续学习和快速迭代

角色解读

  • 成为Agent方向的算法专家,主导核心模型训练与优化,输出高水平论文或产品
  • 向技术管理方向发展,带领团队探索Agent前沿技术并推动业务落地
  • 延伸到多模态、世界模型等更广阔的AI方向,保持技术领先性
  • 构建Agent专用合成数据管线,生产高质量思维链和工具调用轨迹,支撑模型训练
  • 搭建Agent交互环境,如代码执行器、浏览器模拟器,为模型提供实时反馈
  • 应用并改进强化学习算法,提升Agent在长程任务中的成功率和鲁棒性
  • 开发动态评估方案,量化规划能力、工具选择准确率等Agent关键指标
  • 扎实的机器学习与深度学习基础,熟悉LLM原理及Post-Training技术
  • 熟悉强化学习算法及训练基础设施(如Verl/Slime),有分布式训练经验
  • 良好的工程能力,熟练使用Python,能够构建Agent运行环境
  • 了解Agent系统架构,如Function Calling、Tool-Use、Multi-Agent框架

申请策略

  • 了解Accio产品定位和技术栈,准备有见地的分析和想法
  • 展示对AI Agent未来发展的思考和热情,突出学习能力和创新潜质
  • 突出大规模数据合成、Coding Agent或Search Agent相关项目经验
  • 强调对LLM、RL、Agent的理解,如有顶会论文或高影响力开源项目更好
  • 展示工程能力,如使用Verl/Slime等训练框架的经验,并给出具体成果
  • 如果有Agent产品落地经验,详细描述你的角色和贡献
  • 深入学习RLHF、RLVR等Post-Training技术,了解最新论文
  • 熟悉LangChain、AutoGPT等Agent框架,动手实践构建Agent应用

面试指南

  • 回答问题采用STAR法则:先说背景(Situation)、任务(Task),再讲你采取的行动(Action),最后强调结果(Result)并量化
  • 对于技术概念题,先给出定义,再解释关键点,最后联系实际案例
  • 如果遇到不确定的问题,诚实表达并展示思考过程
  • 请谈谈你对Agentic Post-Training的理解,与传统Post-Training有何不同?
  • 如何设计合成数据管线来生成高质量的思维链数据?
  • 在RL训练中,如何处理长程任务的稀疏奖励问题?
  • 你如何评估一个Agent的规划能力和工具选择能力?
  • 请介绍一个你使用RL训练大规模模型的经历和结果

职位点评

71
综合评分

大厂AI前沿Agent岗位,技术成长极强,薪资有竞争力,但工作强度大,WLB不确定。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求前沿技术、渴望快速成长的算法工程师,能接受一定的加班强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值80

薪资福利

70中等

阿里巴巴薪资在行业内具有竞争力,但JD未明确具体范围,综合平台和岗位级别,薪酬保障较好。

薪资信号未披露(AI估算:35K-65K/月)

成长发展

85较高

岗位处于AI前沿技术领域,涉及Agent、LLM、RL等多方向,技术成长空间巨大,但未明确晋升机制。

技术前沿前沿/新兴技术
技术栈Agent、LLM、RL、Post-Training、Verl/Slime
业务类型ambiguous

工作生活

50较低

JD未提及工作生活平衡相关福利,工作地点为科技园,通常需现场办公,可能加班较多。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

80较高

产品是全球首个B2B AI Search Agent,具有行业首创性,对跨境贸易有变革意义,使命感和创新价值强。

行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
Watch Jobs