
阿里巴巴
数据技术及产品部-RL Data工程师-Work方向
数据技术及产品部-RL Data工程师-Work方向
发布于 大约 7 小时前普通员工/个人贡献者
杭州市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Llm
Llm-As-Judge
Rft
Rl
Rubric
数据工程
数据标注
AI 估算 · 30k–50k
阿里AI数据岗位,技术含量高,杭州互联网薪资较高,岗位关键,通常15个月左右。
职位详情
关于这个职位
作为阿里巴巴集团数据技术及产品部的RL Data工程师,你将负责从0到1构建Work(AI协同办公)方向的RL/RFT训练数据体系
工作内容包括领域体系设计、数据构造、质量验证和闭环迭代,是模型训练飞轮中的关键角色
适合具备领域认知、RL数据sense和Python能力的候选人
最低要求
领域深度:在至少一个专业领域有系统性认知,能基于专业判断对 Agent 输出做准确的对错裁定,而不仅凭"看起来合理"
同时具备跨领域快速上手的能力
RL/RFT 数据 sense:熟悉 RFT 和 RL 对数据质量的要求,理解 reasoning 字段在 SFT / RFT / RL 各阶段的作用差异,能筛选与构建高质量的训练数据
Taxonomy 与 instance 设计能力:能独立完成从领域拆解 → 任务类型定义 → instance 模板设计 → 种子来源确定的完整链路
Rubric 设计能力:熟悉主流 rubric 设计范式,能大批量生成高质量 rubric,并把主观评价拆解为可校验的子问题
轨迹级标注与归因能力:能判断多步执行的完整性、正确性、思维连贯性
能准确区分 bad case 是模型能力问题 / 评测标准问题 / 任务定义问题 / 依赖环境问题
轻量工程能力:熟悉 Python,能独立完成数据抓取、清洗、批量调用 LLM、结果聚合等脚本化工作
能读懂 Agent 执行日志和代码片段,判断工具调用是否冗余或有隐性副作用
具备规模化数据生产经验
工作职责
领域任务体系搭建(Taxonomy 设计)
对陌生专业领域做结构化拆解:一级领域 → 二级场景 → 任务类型 → instance 模板,产出可复用、可扩展的标注体系
Instance 与 Reasoning 构造
设计 instance 结构(instruction + context + reasoning + output),并针对不同任务选择合适的 reasoning 获取路径(强模型蒸馏、模板化拆解、真实文本抽取、人机协作等)
保证 reasoning 是 SFT/RFT 训练可直接使用的高质量推理链
分层验证方案设计
针对不同任务定义分层校验机制:规则硬匹配 → 结构完整性 → LLM-as-judge(将主观判断拆解为 yes/no 子问题)
把"评价推理质量"这类模糊问题降维为可自动化、可追溯的子任务
Rubric 与评分标准建设
制定各方向 Rubric、评分分级与标注案例库,定义黄金集(golden sets)和奖励信号(reward signals),确保训练数据质量可量化、可迭代
擅长大批量生成高质量 rubric,而不是拍脑袋写几条规则
轨迹标注与 Bad Case 归因
对模型 Rollout 产出的多步执行轨迹进行逐步标注(正确性 / 必要性 / 思考质量 / 整体 Reward),并对失败步骤做根因分类(模型能力不足 / 评测标准缺陷 / 任务定义模糊 / 运行依赖缺失),输出结构化改进清单驱动训练数据补充与评测体系修正
标注质量管控
建立双标一致性校验、金标抽检、系统性偏差检测与分歧仲裁机制,管理外部数据供应商交付质量、运营内部专家产能,确保标注间一致率 ≥80%,数据可直接用于 Reward Model 训练
外部协作与专家资源整合
与高校老师、领域专家协作定义验收标准、评审样本、迭代规范,把外部资源转化为规模化精标数据
管理供应商时能给出清晰的标注规范、边界案例和仲裁依据
数据 → 模型 → 评测 闭环
周期性输出数据质量报告,识别模型能力薄弱区间,指导算法团队调整 Rollout 抽样策略与难度分布
随模型迭代补充更高难度标注数据,保持 Reward Model 区分度
优先资格
● 有 AI 办公 / Work Agent 场景的产品或数据经验
● 有主导过领域数据集从 0 到 1 建设并支撑训练上线的经历
● 有与高校课题或领域专家合作产出精标数据集的经验
● 熟悉 LLM-as-judge、self-consistency、rejection sampling 等数据自动化验证方法
● 熟悉主流 Agent Benchmark 的评测机制
AI 洞察
优缺点分析
优点
- 处于AI前沿领域,参与构建新一代模型训练数据,技术成长快
- 阿里巴巴大平台,资源丰富,项目影响力大
- 岗位处于模型训练关键链路,职业含金量高
- 能接触不同专业领域,拓展知识广度
- 数据标注和质量管理要求高,工作细致且繁琐
- 需要持续学习新技术,保持竞争力
- 适合对AI数据有热情、具备较强工程能力和领域知识的人,能接受高强度工作
缺点 / 挑战
- 从0到1建设数据体系,挑战性大,需要独立推动
角色解读
- 可向AI数据专家或数据体系负责人发展
- 也可转型RL算法工程师,凭借数据理解优势
- 在阿里巴巴平台上有丰富的内部转岗和晋升机会
- 负责从0到1搭建RL/RFT训练数据体系,包括任务定义、数据构造和验证
- 设计领域taxonomy和instance模板,确保数据覆盖和可扩展性
- 制定Rubric和评分标准,管理标注流程并保证数据质量
- 与算法和评测团队协作,推动数据-模型-评测闭环迭代
- 深厚的RL/RFT数据理解,能筛选构建高质量训练数据
- 具备至少一个领域的专业认知,能对Agent输出做准确判断
- 熟练使用Python进行数据抓取、清洗和批量LLM调用
- 熟悉LLM-as-judge、自我一致性等数据验证方法
申请策略
- 了解阿里巴巴Work产品(如钉钉)的业务方向,结合实际场景准备
- 准备一个从0到1构建数据集的完整案例,展示全链路能力
- 突出RL/RFT或数据体系建设相关项目经验
- 展示Python脚本开发能力和LLM应用案例
- 如有Agent Benchmark或LLM-as-judge经验,务必强调
- 体现跨领域学习和快速上手能力
- 进修RLHF、RFT相关课程,深入理解训练数据需求
- 实践LLM-as-judge等数据自动化验证方法
面试指南
- 用STAR法则组织回答:背景-任务-行动-结果,重点突出决策逻辑和数据sense
- 对于技术问题,先讲原理再结合实例,展示工程落地能力
- 对于开放问题,体现结构化思维,先拆解再讲方案
- RFT和RL对训练数据质量的要求有何不同?
- 如何为一个陌生领域设计Taxonomy和Instance模板?
- 如何对Agent执行轨迹进行Bad Case归因?
- 如何保证数据标注的一致率≥80%?
- 请介绍一个你主导的数据集建设项目
职位点评
76
综合评分
阿里大厂AI数据核心岗位,前沿技术高成长,但工作强度可能较大,JD未明确WLB。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、对AI数据有热情、能适应高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展88
工作生活55
使命价值70
薪资福利
80较高
阿里巴巴作为大厂,薪资福利有竞争力,但JD未具体披露,综合判断较好。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
88较高
岗位处于AI前沿,涉及RL/RFT,技术成长空间大,能积累高价值数据经验。
技术前沿前沿/新兴技术
技术栈RL、RFT、LLM、Python、Taxonomy、Rubric、LLM-as-judge、Agent
业务类型ambiguous
工作生活
55较低
仅现场办公,未提及弹性,阿里巴巴工作强度通常较高,生活平衡一般。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
70中等
参与AI模型训练数据建设,推动AI发展,有一定意义感,但主要体现技术价值。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs