Alibaba logo
阿里巴巴
智多星RL Data - Coding方向

智多星RL Data - Coding方向

发布于 大约 14 小时前

普通员工/个人贡献者

杭州市
专家级经验
全职员工
仅现场办公
博士
机器学习工程
Agentic
Dapo
Grpo
Post-Training
Ppo
Reward Modeling
Rl
Rubric
Trajectory Evaluation

AI 估算 · 40k–60k

阿里巴巴作为互联网巨头,薪资水平较高,该岗位要求博士学历和RL经验,属于高技能岗位,月薪4-6万,16薪,总包约64-96万。

职位详情

关于这个职位

该职位负责阿里巴巴RL数据(Coding方向)项目,端到端管理从方案设计到规模化生产的数据流程,设计Rubric评估体系,构建QA框架,归纳失败模式,与算法团队协作优化模型性能

适合具备强化学习、Agentic评估经验,精通Python,能处理复杂数据流程的博士或优秀硕士

最低要求

在读博士生优先(特别优秀的硕士生可放宽)

计算机、人工智能、软件工程、认知科学、脑科学或其他 AI 相关专业
具备 RL/Post-Training 研究背景、Applied Scientist 经历,有 Agentic/轨迹评估方面的深度经验
能够将模糊的质量目标编码为可执行、可量化、可扩展的评估标准
熟练的编程能力(Python 为主),能独立完成数据处理脚本、pipeline 开发和自动化工具搭建
能读懂 Agent 轨迹(多轮工具调用、代码执行、搜索检索等),理解 Agentic 系统的行为模式和失败模式
了解 Reward Modeling 基本原理,理解 Reward 信号设计对 RL 训练(PPO/GRPO/DAPO 等)的影响
优秀的书面表达和文档能力,能撰写清晰的 Rubric 规范和技术方案

工作职责

端到端负责RL数据(coding 方向)项目:从方案设计、数据有效性验证到规模化生产,帮助模型在性能上达到业界SOTA

Rubric 与评估体系设计:将业务目标和模型能力目标抽象为多维度、层级化的评分标准(Rubric),设计权重、评分规则和边界 case 处理策略
持续迭代 Rubric 以覆盖新场景、堵住 reward hacking 路径
RL Data 生产与质量保障:端到端负责 Agentic 场景的数据生产项目,从任务设计、轨迹采样、标注执行到质量验收
构建 QA 框架,对 Grader 输出做一致性校验和失败模式分析,确保进入训练的数据可信
失败模式归纳与数据迭代: 从大量 Trajectory 中归纳 Error Taxonomy,建立失败模式分类体系,将分析结论转化为数据策略调整(任务难度、Reward 信号修正、标注规范更新),形成数据飞轮闭环
协同算法团队闭环:与模型训练/RL算法团队紧密配合,对接 Reward/Grader 需求, 将模型效果反馈翻译为数据改进策略
数据体系设计:负责主导 Code 方向标注规范的制定与持续迭代,覆盖代码生成、代码补全、debug、代码解释、代码审查等多类任务
设计 Agentic 场景下的标注框架,包括 multi-step reasoning、tool use、planning、self-correction 等复杂任务链的拆解与评估标准
基于模型表现与研究进展,持续优化标注指南,确保数据质量与训练目标对齐
探索更科学的评测指标、更高效的评测方法

AI 洞察

优缺点分析

优点

  • 阿里巴巴平台大,技术资源丰富,能接触前沿AI技术
  • 岗位核心,参与模型训练关键环节,个人成长快
  • 薪资竞争力强,福利完善
  • 工作强度大,需要快速迭代和应对复杂问题
  • 对综合能力要求高,需同时具备研究、工程和沟通能力

缺点 / 挑战

  • 数据质量责任重大,压力较大
  • 适合对RL和Agentic系统有深入理解,喜欢挑战,具备强大工程能力和研究精神的博士或优秀硕士

角色解读

  • 在数据领域深耕,成为RL数据专家,主导数据策略和评估体系
  • 向算法工程师转型,参与模型训练和优化,晋升为技术专家
  • 在AI行业积累经验,可转向AI产品经理或技术管理岗位
  • 负责RL数据项目的全流程管理,包括方案设计、数据生产、质量保障和迭代优化
  • 设计Rubric评估体系,将模型能力目标转化为可量化的评分标准,并持续迭代以应对新场景
  • 分析Agent轨迹数据,归纳失败模式,并转化为数据策略调整,形成数据飞轮
  • 与算法团队紧密协作,将模型效果反馈转化为数据改进策略,支持模型训练
  • 扎实的RL和Post-Training知识,理解PPO、GRPO等算法原理
  • 精通Python编程,能独立开发数据处理pipeline和自动化工具
  • 具备Agentic系统评估经验,能设计Rubric和QA框架
  • 优秀的文档能力,能清晰撰写技术方案和标注规范

申请策略

  • 了解阿里巴巴AI战略和产品,展示对业务的理解
  • 强调对数据质量的执着和细节关注
  • 突出RL/Post-Training项目经验,尤其是Agentic评估相关
  • 强调Python编程和数据处理能力,展示pipeline开发案例
  • 展示Rubric设计或评估体系构建的成果
  • 如有论文或专利,突出学术贡献
  • 深入学习RL算法,如PPO、GRPO,了解最新进展
  • 实践Agentic系统,熟悉轨迹分析和评估工具

面试指南

  • 用STAR法则回答行为问题,突出具体行动和结果
  • 技术问题结合项目经验,展示深度理解和实践
  • 设计问题展示逻辑思维,从目标到方案,考虑权衡
  • 如何设计Rubric来评估Agent的轨迹质量?
  • 描述一个你处理过的数据质量挑战,如何解决?
  • 如何将模型性能问题转化为数据改进策略?
  • 你对PPO和GRPO的理解,以及它们对数据需求的影响?
  • 如何设计QA框架来保证数据一致性?

职位点评

77
综合评分

阿里核心数据岗位,前沿技术,高成长,但工作强度可能较大。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和前沿研究,能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值85

薪资福利

80较高

阿里巴巴提供有竞争力的薪资和福利,但具体薪资未披露,整体补偿性较好。

薪资信号未披露(AI估算:40K-60K/月)

成长发展

90较高

岗位涉及前沿RL技术,强调数据飞轮和迭代,成长空间大,发展性动机强。

技术前沿前沿/新兴技术
技术栈RL、Post-Training、Agentic、Reward Modeling、PPO、GRPO、DAPO
成长机会持续迭代、数据飞轮闭环、探索更科学的评测指标
业务类型profit_center

工作生活

50较低

工作地点在杭州,未提及远程或弹性,可能需现场办公,生活化满足度一般。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

岗位推动AI模型性能提升,具有技术前沿性,意义感较强。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号帮助模型在性能上达到业界SOTA
创新程度积极采用新技术
Watch Jobs