Alibaba logo
阿里巴巴
晓天衡宇-大模型标注评测工程师-后端方向

晓天衡宇-大模型标注评测工程师-后端方向

发布于 大约 14 小时前

普通员工/个人贡献者

杭州市
中级经验
全职员工
仅现场办公
学历未注明
数据工程
Ai Coding
Go
Llm
大模型评测
数据标注
数据质量
代码审阅

AI 估算 · 25k–45k

阿里平台,大模型数据方向紧缺,3年以上后端经验,薪资有竞争力。

职位详情

关于这个职位

该职位主要负责验收大模型AI Coding方向的数据质量,制定标注规范,管控标注团队产出,并对标注员进行技术赋能

你将成为模型训练数据质量的守门人,与团队共同探索更科学的标注和评测方法,推动大模型能力的持续进化
适合有后端开发经验、对数据质量和AI技术充满热情的技术人员

最低要求

有真实后端软件开发经验 — 具备 Java、Python、Go、C++ 等语言项目开发经历,了解微服务、RESTful API、数据库设计等后端核心知识

具备代码审阅与质量判断能力 — 能读懂他人代码,判断实现正确性、边界处理与风险点,识别似是而非的错误答案
熟悉工程协作与研发规范 — 理解代码 Review、接口文档、需求说明、单元测试、日志分析等研发协作产物
具备结构化表达与标准化能力 — 能把质检问题清晰描述为缺陷类型、判定依据、影响范围与整改建议,并沉淀为可复用的验收标准
深刻理解模型能力发展脉络,能预判下一阶段的标注和评测重点
熟悉从基础能力到复杂能力的演进路径
理解训练数据的分布和特点,能设计针对性的评测来检验数据效果
具备反作弊意识,能识别模型是"真懂"还是"背题"

工作职责

验收后端方向 AI Coding 数据质量 — 对标注团队产出的 bug-fix、feature 开发、refactor 等任务数据进行质量验收,核查任务设计的真实性、难度合理性与工程场景还原度

标注规范与数据设计:负责主导 Code 方向标注规范的制定与持续迭代,覆盖代码生成、代码补全、debug、代码解释、代码审查等多类任务
设计 Agentic 场景下的标注框架,包括 multi-step reasoning、tool use、planning、self-correction 等复杂任务链的拆解与评估标准
基于模型表现与研究进展,持续优化标注指南,确保数据质量与训练目标对齐;
数据质量管控:对标注员产出进行专家级审核,重点识别代码逻辑错误、安全漏洞、风格一致性问题
建立 Code / Agentic 数据质量评估体系,定义量化指标并追踪质量趋势
设计并执行标注一致性校验流程(IAA),提升跨标注员的数据稳定性;
标注团队赋能:为标注员提供技术培训,将复杂的代码和 Agent 概念转化为可操作的标注实践
担任技术难题的终极裁判,解决边界案例和歧义问题
参与标注工具需求设计,提升代码标注效率;
探索更科学的评测指标、更高效的评测和标注方法

优先资格

加分项:参与过大模型(LLM)数据项目标注/评测/质检/验收工作

AI 洞察

优缺点分析

优点

  • 身处大模型浪潮核心,接触最前沿的AI Coding和Agentic技术,技术视野开阔
  • 阿里巴巴平台提供海量数据和强大基础设施,职业发展空间大
  • 工作涉及数据、模型、工程多个维度,技能复合性强,个人价值提升快
  • 薪资和福利在行业内具有较强竞争力
  • 大模型技术迭代快,需要持续学习,保持对前沿动态的敏感度
  • 作为质量守门人,需在团队中扮演技术裁判角色,沟通和权威性要求高

缺点 / 挑战

  • 需要同时具备后端开发经验和对大模型的理解,门槛较高
  • 数据标注评测工作细致且重复性高,需要极大的耐心和责任心
  • 适合有后端开发背景、对AI数据质量有热情、细心严谨且乐于接受技术挑战的工程师

角色解读

  • 在AI数据领域深耕,成为大模型数据质量与评测方向的专家
  • 可向AI数据团队的技术管理岗位发展,负责更大规模的数据质量和标注团队
  • 积累大模型训练数据的深度认知,有机会转向模型评测、训练数据设计等更核心的AI研发岗位
  • 负责验收AI Coding相关的数据质量,对标注团队生成的代码任务进行专家级审核,确保数据真实、合理且贴近工程场景
  • 主导标注规范的制定与迭代,覆盖代码生成、补全、debug、解释、审查等任务,并设计Agentic场景下复杂任务链的标注框架
  • 建立数据质量评估体系和一致性校验流程,通过量化指标追踪质量趋势,并解决标注过程中的边界和歧义问题
  • 为标注团队提供技术培训,将复杂的技术概念转化为可操作的标注实践,同时参与标注工具的需求设计以提升效率
  • 扎实的后端开发经验,熟悉Java、Python、Go、C++等至少一种语言,理解微服务、RESTful API和数据库设计
  • 具备优秀的代码审阅能力,能够准确判断代码的正确性、边界处理和潜在风险
  • 熟悉工程协作规范,包括代码Review、接口文档、单元测试和日志分析
  • 具备结构化表达和标准化能力,能将质量问题清晰描述并沉淀为可复用的标准

申请策略

  • 在申请中表达对AI数据质量的独到见解,展示你对“模型为什么会出错”的思考
  • 了解阿里巴巴晓天衡宇部门的具体业务,准备相关案例来体现你的匹配度
  • 突出后端项目经验,尤其是涉及复杂业务逻辑、代码审查和性能优化的案例
  • 如果有参与过大模型数据标注、评测或质检项目,务必强调具体职责和成果
  • 展示对代码质量的追求,例如写过代码规范、设计过测试体系或参与过Code Review流程
  • 体现结构化思维,如将模糊问题转化为可量化标准的经历
  • 学习大模型的基础知识和评测方法,了解LLM的原理和常见评测指标
  • 熟悉Agentic相关概念,如multi-step reasoning、tool use、planning等

面试指南

  • 对于技术评判类问题,采用“背景-方法-结果”(STAR)结构,清晰阐述你的决策依据和验证过程
  • 对于规范设计类问题,从目的、步骤、量化指标、迭代机制等角度展开,体现系统化思维
  • 对于模型相关的问题,结合对LLM训练和推理机制的理解,从数据和模型交互的角度分析
  • 请举例说明你如何判断一个代码修复是否真正解决了问题?
  • 如果让你设计一个针对代码生成任务的标注规范,你会考虑哪些维度?
  • 你如何看待模型在运行中出现的“背题”现象?如何设计评测来识别?
  • 如何评估标注员之间的一致性?你会采用什么方法?
  • 你如何理解AI Coding场景下的数据质量?与普通软件测试有何异同?

职位点评

70
综合评分

大厂AI数据质量岗,技术前沿成长快,但工作强度大、WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长、希望深耕AI数据领域的求职者,能接受高强度工作节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活40
使命价值70

薪资福利

75中等

该职位提供有竞争力的薪资和阿里平台福利,但薪资未在JD中明确,具体需面议。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

85较高

岗位处于大模型数据前沿,技术挑战大,成长空间广阔,能深度参与AI数据体系建设。

技术前沿前沿/新兴技术
技术栈LLM、AI Coding、数据标注、评测、Agent
业务类型ambiguous

工作生活

40较低

要求现场办公,未提及弹性工作或WLB,阿里工作节奏通常较快,生活平衡挑战较大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

工作直接贡献于大模型能力的提升,具有推动技术发展的意义,但社会价值相对间接。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs