
阿里巴巴
晓天衡宇-大模型标注评测工程师-系统底层方向(成都)
晓天衡宇-大模型标注评测工程师-系统底层方向(成都)
发布于 大约 8 小时前普通员工/个人贡献者
成都市
中级经验
全职员工
仅现场办公
学历未注明
数据运营
Agentic
Cmake
Gdb/Lldb
Llm
Valgrind
内存管理
并发编程
数据标注
AI 估算 · 20k–35k
大模型数据标注评测需求旺,需底层开发技能,阿里平台薪资竞争力强,成都成本较低,薪资中上。
职位详情
关于这个职位
这个职位负责系统底层方向AI Coding数据质量验收,制定代码生成、调试等任务的标注规范和评测框架,并对标注团队进行技术培训
适合具备C/C++/Rust等底层开发经验、对LLM数据标注与评测感兴趣的技术人才,工作地点在成都
最低要求
有真实系统底层或高性能开发经验 — 熟练使用 C、C++、Rust 等语言,了解操作系统、内存管理、并发编程、编译链路等底层核心知识
具备代码审阅与质量判断能力 — 能读懂底层代码,判断实现正确性、内存安全、并发与性能问题,识别似是而非的错误答案
熟悉底层工程协作与调试工具 — 理解 GDB/LLDB 调试、perf/Valgrind 性能与内存分析、CMake/Makefile 构建、系统日志与崩溃分析等工程实践
具备结构化表达与标准化能力 — 能把质检问题清晰描述为缺陷类型、判定依据、影响范围与整改建议,并沉淀为可复用的验收标准
深刻理解模型能力发展脉络,能预判下一阶段的标注和评测重点
熟悉从基础能力到复杂能力的演进路径
理解训练数据的分布和特点,能设计针对性的评测来检验数据效果
具备反作弊意识,能识别模型是"真懂"还是"背题"
工作职责
验收系统底层方向 AI Coding 数据质量 — 对底层 bug-fix、性能优化、内存/并发问题修复、嵌入式功能开发等任务数据进行质量验收,核查任务设计的真实性、难度合理性与工程场景还原度
标注规范与数据设计:负责主导 Code 方向标注规范的制定与持续迭代,覆盖代码生成、代码补全、debug、代码解释、代码审查等多类任务
设计 Agentic 场景下的标注框架,包括 multi-step reasoning、tool use、planning、self-correction 等复杂任务链的拆解与评估标准
基于模型表现与研究进展,持续优化标注指南,确保数据质量与训练目标对齐;
数据质量管控:对标注员产出进行专家级审核,重点识别代码逻辑错误、安全漏洞、风格一致性问题
建立 Code / Agentic 数据质量评估体系,定义量化指标并追踪质量趋势
设计并执行标注一致性校验流程(IAA),提升跨标注员的数据稳定性;
标注团队赋能:为标注员提供技术培训,将复杂的代码和 Agent 概念转化为可操作的标注实践
担任技术难题的终极裁判,解决边界案例和歧义问题
参与标注工具需求设计,提升代码标注效率;
探索更科学的评测指标、更高效的评测和标注方法
优先资格
参与过大模型(LLM)数据项目标注/评测/质检 / 验收工作
AI 洞察
优缺点分析
优点
- 处于大模型前沿领域,接触AI Coding核心数据,学习成长快
- 阿里平台资源丰富,数据规模和工程体系成熟
- 需要底层系统开发能力,技术壁垒高,职业价值提升
- 成都base,生活成本相对较低,稳定性好
- 跨团队协作多,需要与技术、标注团队高效沟通
- 适合有系统底层开发经验、对数据标注和评测有热情、注重细节且乐于沉淀标准的技术人才
缺点 / 挑战
- 工作涉及大量重复性质量审核,可能比较枯燥
- 需要不断跟踪模型演进,快速适应新任务,学习压力大
角色解读
- 可向大模型数据工程专家方向发展,深入评测与标注方法论
- 可转向AI Coding方向算法工程师,深入模型训练与数据闭环
- 有机会成为数据团队负责人,管理标注规范与团队
- 负责系统底层方向AI Coding数据的质量验收,核查bug修复、性能优化等任务的真实性与难度
- 制定和迭代代码生成、补全、debug等任务的标注规范,设计Agentic场景的标注框架
- 对标注员产出进行专家级审核,建立质量评估体系并执行一致性校验(IAA)
- 为标注员提供技术培训,解决边界案例,并探索更科学的评测指标
- 熟练掌握C/C++/Rust,了解操作系统、内存管理、并发编程等底层知识
- 具备代码审阅能力,能识别内存安全、并发与性能问题
- 熟悉GDB/LLDB调试、perf/Valgrind分析、CMake等工程工具
- 具备结构化表达和标准化能力,能沉淀验收标准
申请策略
- 申请时强调对AI数据质量的兴趣和系统底层技术背景
- 可以准备一个自己参与的底层bug修复案例,展示判断能力
- 突出C/C++/Rust开发经验和底层系统项目(如内存优化、并发修复)
- 强调代码审查、质量评估相关经历,如bug修复案例
- 如果有LLM数据项目参与经历,一定要突出
- 展示结构化文档能力,如标准规范撰写
- 学习常用调试和性能分析工具,如GDB、perf
- 了解大模型基础知识和典型Agentic工作流
面试指南
- 针对这些技术问题,建议使用STAR原则回答:背景-任务-行动-结果
- 对于代码质量问题,可以从正确性、性能、可读性等维度分析
- 对于评测设计,可以结合数据特点和模型训练目标阐述思路
- 请描述一个你修复过的内存泄漏或并发bug,如何定位和解决?
- 如何判断一个代码修复的质量?有哪些维度?
- 你了解大模型评测的常用指标吗?如何设计一个评测任务?
- 如果标注员对同一代码样本有分歧,你会如何处理?
- 你如何理解Agentic场景中的multi-step reasoning标注?
职位点评
70
综合评分
前沿大模型数据岗,技术含量高,发展空间大,但工作地点需现场,薪资未明确披露。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合重视技术成长和行业前景的求职者,对工作生活平衡要求较高者需权衡。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值70
薪资福利
70中等
薪资虽未在JD中披露,但阿里巴巴平台通常提供有竞争力的薪酬,且成都生活成本较低,整体补偿性较好。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
85较高
职位位于大模型数据前沿,涉及Agentic场景,技术成长空间大,能深入了解模型训练数据全链路,发展机会良好。
技术前沿前沿/新兴技术
技术栈C++、Rust、LLM、Agentic、数据标注、评测
业务类型ambiguous
工作生活
50较低
JD未提及远程或弹性工作安排,现场办公几率较大,但未提供WLB相关信息,不确定性中等。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
工作通过提升AI Coding模型的数据质量,间接推动AI技术发展,具有行业意义,属于高速增长的赛道。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs