Alibaba logo
阿里巴巴
数据技术及产品部-RL Data工程师-Work方向

数据技术及产品部-RL Data工程师-Work方向

发布于 大约 7 小时前

普通员工/个人贡献者

杭州市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Llm
Llm-As-Judge
Rft
Rl
Rubric
数据工程
数据标注

AI 估算 · 30k–50k

阿里AI数据岗位,技术含量高,杭州互联网薪资较高,岗位关键,通常15个月左右。

职位详情

关于这个职位

作为阿里巴巴集团数据技术及产品部的RL Data工程师,你将负责从0到1构建Work(AI协同办公)方向的RL/RFT训练数据体系

工作内容包括领域体系设计、数据构造、质量验证和闭环迭代,是模型训练飞轮中的关键角色
适合具备领域认知、RL数据sense和Python能力的候选人

最低要求

领域深度:在至少一个专业领域有系统性认知,能基于专业判断对 Agent 输出做准确的对错裁定,而不仅凭"看起来合理"

同时具备跨领域快速上手的能力
RL/RFT 数据 sense:熟悉 RFT 和 RL 对数据质量的要求,理解 reasoning 字段在 SFT / RFT / RL 各阶段的作用差异,能筛选与构建高质量的训练数据
Taxonomy 与 instance 设计能力:能独立完成从领域拆解 → 任务类型定义 → instance 模板设计 → 种子来源确定的完整链路
Rubric 设计能力:熟悉主流 rubric 设计范式,能大批量生成高质量 rubric,并把主观评价拆解为可校验的子问题
轨迹级标注与归因能力:能判断多步执行的完整性、正确性、思维连贯性
能准确区分 bad case 是模型能力问题 / 评测标准问题 / 任务定义问题 / 依赖环境问题
轻量工程能力:熟悉 Python,能独立完成数据抓取、清洗、批量调用 LLM、结果聚合等脚本化工作
能读懂 Agent 执行日志和代码片段,判断工具调用是否冗余或有隐性副作用
具备规模化数据生产经验

工作职责

领域任务体系搭建(Taxonomy 设计)

对陌生专业领域做结构化拆解:一级领域 → 二级场景 → 任务类型 → instance 模板,产出可复用、可扩展的标注体系
Instance 与 Reasoning 构造
设计 instance 结构(instruction + context + reasoning + output),并针对不同任务选择合适的 reasoning 获取路径(强模型蒸馏、模板化拆解、真实文本抽取、人机协作等)
保证 reasoning 是 SFT/RFT 训练可直接使用的高质量推理链
分层验证方案设计
针对不同任务定义分层校验机制:规则硬匹配 → 结构完整性 → LLM-as-judge(将主观判断拆解为 yes/no 子问题)
把"评价推理质量"这类模糊问题降维为可自动化、可追溯的子任务
Rubric 与评分标准建设
制定各方向 Rubric、评分分级与标注案例库,定义黄金集(golden sets)和奖励信号(reward signals),确保训练数据质量可量化、可迭代
擅长大批量生成高质量 rubric,而不是拍脑袋写几条规则
轨迹标注与 Bad Case 归因
对模型 Rollout 产出的多步执行轨迹进行逐步标注(正确性 / 必要性 / 思考质量 / 整体 Reward),并对失败步骤做根因分类(模型能力不足 / 评测标准缺陷 / 任务定义模糊 / 运行依赖缺失),输出结构化改进清单驱动训练数据补充与评测体系修正
标注质量管控
建立双标一致性校验、金标抽检、系统性偏差检测与分歧仲裁机制,管理外部数据供应商交付质量、运营内部专家产能,确保标注间一致率 ≥80%,数据可直接用于 Reward Model 训练
外部协作与专家资源整合
与高校老师、领域专家协作定义验收标准、评审样本、迭代规范,把外部资源转化为规模化精标数据
管理供应商时能给出清晰的标注规范、边界案例和仲裁依据
数据 → 模型 → 评测 闭环
周期性输出数据质量报告,识别模型能力薄弱区间,指导算法团队调整 Rollout 抽样策略与难度分布
随模型迭代补充更高难度标注数据,保持 Reward Model 区分度

优先资格

● 有 AI 办公 / Work Agent 场景的产品或数据经验

● 有主导过领域数据集从 0 到 1 建设并支撑训练上线的经历
● 有与高校课题或领域专家合作产出精标数据集的经验
● 熟悉 LLM-as-judge、self-consistency、rejection sampling 等数据自动化验证方法
● 熟悉主流 Agent Benchmark 的评测机制

AI 洞察

优缺点分析

优点

  • 处于AI前沿领域,参与构建新一代模型训练数据,技术成长快
  • 阿里巴巴大平台,资源丰富,项目影响力大
  • 岗位处于模型训练关键链路,职业含金量高
  • 能接触不同专业领域,拓展知识广度
  • 数据标注和质量管理要求高,工作细致且繁琐
  • 需要持续学习新技术,保持竞争力
  • 适合对AI数据有热情、具备较强工程能力和领域知识的人,能接受高强度工作

缺点 / 挑战

  • 从0到1建设数据体系,挑战性大,需要独立推动

角色解读

  • 可向AI数据专家或数据体系负责人发展
  • 也可转型RL算法工程师,凭借数据理解优势
  • 在阿里巴巴平台上有丰富的内部转岗和晋升机会
  • 负责从0到1搭建RL/RFT训练数据体系,包括任务定义、数据构造和验证
  • 设计领域taxonomy和instance模板,确保数据覆盖和可扩展性
  • 制定Rubric和评分标准,管理标注流程并保证数据质量
  • 与算法和评测团队协作,推动数据-模型-评测闭环迭代
  • 深厚的RL/RFT数据理解,能筛选构建高质量训练数据
  • 具备至少一个领域的专业认知,能对Agent输出做准确判断
  • 熟练使用Python进行数据抓取、清洗和批量LLM调用
  • 熟悉LLM-as-judge、自我一致性等数据验证方法

申请策略

  • 了解阿里巴巴Work产品(如钉钉)的业务方向,结合实际场景准备
  • 准备一个从0到1构建数据集的完整案例,展示全链路能力
  • 突出RL/RFT或数据体系建设相关项目经验
  • 展示Python脚本开发能力和LLM应用案例
  • 如有Agent Benchmark或LLM-as-judge经验,务必强调
  • 体现跨领域学习和快速上手能力
  • 进修RLHF、RFT相关课程,深入理解训练数据需求
  • 实践LLM-as-judge等数据自动化验证方法

面试指南

  • 用STAR法则组织回答:背景-任务-行动-结果,重点突出决策逻辑和数据sense
  • 对于技术问题,先讲原理再结合实例,展示工程落地能力
  • 对于开放问题,体现结构化思维,先拆解再讲方案
  • RFT和RL对训练数据质量的要求有何不同?
  • 如何为一个陌生领域设计Taxonomy和Instance模板?
  • 如何对Agent执行轨迹进行Bad Case归因?
  • 如何保证数据标注的一致率≥80%?
  • 请介绍一个你主导的数据集建设项目

职位点评

76
综合评分

阿里大厂AI数据核心岗位,前沿技术高成长,但工作强度可能较大,JD未明确WLB。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长、对AI数据有热情、能适应高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展88
工作生活55
使命价值70

薪资福利

80较高

阿里巴巴作为大厂,薪资福利有竞争力,但JD未具体披露,综合判断较好。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

88较高

岗位处于AI前沿,涉及RL/RFT,技术成长空间大,能积累高价值数据经验。

技术前沿前沿/新兴技术
技术栈RL、RFT、LLM、Python、Taxonomy、Rubric、LLM-as-judge、Agent
业务类型ambiguous

工作生活

55较低

仅现场办公,未提及弹性,阿里巴巴工作强度通常较高,生活平衡一般。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

70中等

参与AI模型训练数据建设,推动AI发展,有一定意义感,但主要体现技术价值。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs