Alibaba logo
阿里巴巴
晓天衡宇-大模型标注评测工程师-系统底层方向(成都)

晓天衡宇-大模型标注评测工程师-系统底层方向(成都)

发布于 大约 8 小时前

普通员工/个人贡献者

成都市
中级经验
全职员工
仅现场办公
学历未注明
数据运营
Agentic
Cmake
Gdb/Lldb
Llm
Valgrind
内存管理
并发编程
数据标注

AI 估算 · 20k–35k

大模型数据标注评测需求旺,需底层开发技能,阿里平台薪资竞争力强,成都成本较低,薪资中上。

职位详情

关于这个职位

这个职位负责系统底层方向AI Coding数据质量验收,制定代码生成、调试等任务的标注规范和评测框架,并对标注团队进行技术培训

适合具备C/C++/Rust等底层开发经验、对LLM数据标注与评测感兴趣的技术人才,工作地点在成都

最低要求

有真实系统底层或高性能开发经验 — 熟练使用 C、C++、Rust 等语言,了解操作系统、内存管理、并发编程、编译链路等底层核心知识

具备代码审阅与质量判断能力 — 能读懂底层代码,判断实现正确性、内存安全、并发与性能问题,识别似是而非的错误答案
熟悉底层工程协作与调试工具 — 理解 GDB/LLDB 调试、perf/Valgrind 性能与内存分析、CMake/Makefile 构建、系统日志与崩溃分析等工程实践
具备结构化表达与标准化能力 — 能把质检问题清晰描述为缺陷类型、判定依据、影响范围与整改建议,并沉淀为可复用的验收标准
深刻理解模型能力发展脉络,能预判下一阶段的标注和评测重点
熟悉从基础能力到复杂能力的演进路径
理解训练数据的分布和特点,能设计针对性的评测来检验数据效果
具备反作弊意识,能识别模型是"真懂"还是"背题"

工作职责

验收系统底层方向 AI Coding 数据质量 — 对底层 bug-fix、性能优化、内存/并发问题修复、嵌入式功能开发等任务数据进行质量验收,核查任务设计的真实性、难度合理性与工程场景还原度

标注规范与数据设计:负责主导 Code 方向标注规范的制定与持续迭代,覆盖代码生成、代码补全、debug、代码解释、代码审查等多类任务
设计 Agentic 场景下的标注框架,包括 multi-step reasoning、tool use、planning、self-correction 等复杂任务链的拆解与评估标准
基于模型表现与研究进展,持续优化标注指南,确保数据质量与训练目标对齐;
数据质量管控:对标注员产出进行专家级审核,重点识别代码逻辑错误、安全漏洞、风格一致性问题
建立 Code / Agentic 数据质量评估体系,定义量化指标并追踪质量趋势
设计并执行标注一致性校验流程(IAA),提升跨标注员的数据稳定性;
标注团队赋能:为标注员提供技术培训,将复杂的代码和 Agent 概念转化为可操作的标注实践
担任技术难题的终极裁判,解决边界案例和歧义问题
参与标注工具需求设计,提升代码标注效率;
探索更科学的评测指标、更高效的评测和标注方法

优先资格

参与过大模型(LLM)数据项目标注/评测/质检 / 验收工作

AI 洞察

优缺点分析

优点

  • 处于大模型前沿领域,接触AI Coding核心数据,学习成长快
  • 阿里平台资源丰富,数据规模和工程体系成熟
  • 需要底层系统开发能力,技术壁垒高,职业价值提升
  • 成都base,生活成本相对较低,稳定性好
  • 跨团队协作多,需要与技术、标注团队高效沟通
  • 适合有系统底层开发经验、对数据标注和评测有热情、注重细节且乐于沉淀标准的技术人才

缺点 / 挑战

  • 工作涉及大量重复性质量审核,可能比较枯燥
  • 需要不断跟踪模型演进,快速适应新任务,学习压力大

角色解读

  • 可向大模型数据工程专家方向发展,深入评测与标注方法论
  • 可转向AI Coding方向算法工程师,深入模型训练与数据闭环
  • 有机会成为数据团队负责人,管理标注规范与团队
  • 负责系统底层方向AI Coding数据的质量验收,核查bug修复、性能优化等任务的真实性与难度
  • 制定和迭代代码生成、补全、debug等任务的标注规范,设计Agentic场景的标注框架
  • 对标注员产出进行专家级审核,建立质量评估体系并执行一致性校验(IAA)
  • 为标注员提供技术培训,解决边界案例,并探索更科学的评测指标
  • 熟练掌握C/C++/Rust,了解操作系统、内存管理、并发编程等底层知识
  • 具备代码审阅能力,能识别内存安全、并发与性能问题
  • 熟悉GDB/LLDB调试、perf/Valgrind分析、CMake等工程工具
  • 具备结构化表达和标准化能力,能沉淀验收标准

申请策略

  • 申请时强调对AI数据质量的兴趣和系统底层技术背景
  • 可以准备一个自己参与的底层bug修复案例,展示判断能力
  • 突出C/C++/Rust开发经验和底层系统项目(如内存优化、并发修复)
  • 强调代码审查、质量评估相关经历,如bug修复案例
  • 如果有LLM数据项目参与经历,一定要突出
  • 展示结构化文档能力,如标准规范撰写
  • 学习常用调试和性能分析工具,如GDB、perf
  • 了解大模型基础知识和典型Agentic工作流

面试指南

  • 针对这些技术问题,建议使用STAR原则回答:背景-任务-行动-结果
  • 对于代码质量问题,可以从正确性、性能、可读性等维度分析
  • 对于评测设计,可以结合数据特点和模型训练目标阐述思路
  • 请描述一个你修复过的内存泄漏或并发bug,如何定位和解决?
  • 如何判断一个代码修复的质量?有哪些维度?
  • 你了解大模型评测的常用指标吗?如何设计一个评测任务?
  • 如果标注员对同一代码样本有分歧,你会如何处理?
  • 你如何理解Agentic场景中的multi-step reasoning标注?

职位点评

70
综合评分

前沿大模型数据岗,技术含量高,发展空间大,但工作地点需现场,薪资未明确披露。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合重视技术成长和行业前景的求职者,对工作生活平衡要求较高者需权衡。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值70

薪资福利

70中等

薪资虽未在JD中披露,但阿里巴巴平台通常提供有竞争力的薪酬,且成都生活成本较低,整体补偿性较好。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

85较高

职位位于大模型数据前沿,涉及Agentic场景,技术成长空间大,能深入了解模型训练数据全链路,发展机会良好。

技术前沿前沿/新兴技术
技术栈C++、Rust、LLM、Agentic、数据标注、评测
业务类型ambiguous

工作生活

50较低

JD未提及远程或弹性工作安排,现场办公几率较大,但未提供WLB相关信息,不确定性中等。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

工作通过提升AI Coding模型的数据质量,间接推动AI技术发展,具有行业意义,属于高速增长的赛道。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs