Alibaba logo
阿里巴巴
数据技术及产品部-LLM评测专家-通用及垂类方向

数据技术及产品部-LLM评测专家-通用及垂类方向

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 杭州市
中级经验
全职员工
仅现场办公
本科
机器学习工程
Llm
Llm-As-Judge
大模型评测
推理能力
数据分析
机器学习
评测体系

AI 估算 · 30k–55k

大厂核心算法岗,LLM方向稀缺,薪资竞争力强,通常含16薪。

职位详情

关于这个职位

这是一份负责大模型评测体系建设的专业职位,你将在阿里巴巴数据技术及产品部深入探索LLM的能力边界,设计并迭代覆盖多学科的评测方案

你会与顶尖算法工程师、各领域专家紧密协作,分析模型bad case,推动大模型不断进化
如果你对大模型底层能力充满好奇,希望在AI浪潮中扮演质量守门人的角色,这个职位将提供广阔平台

最低要求

本科及以上学历,工程科学、数学、物理、化学、生物、医学、语言学、文学、法律、金融、心理学或相关学科专业优先

具备良好的学科知识素养,至少在一个学科领域(工程科学/自然科学/医学/法律/金融等)有较深入的理解,能够提供专家级的评测方案
对大模型的推理流程、能力边界有基本认知,了解主流学科评测集的设计思路与局限性,有实际构建或深度分析过至少一个领域评测集的经验优先
较强的跨领域沟通能力与团队协作意识,能与不同学科背景的研究人员、算法团队及外部专家高效配合,将学科需求准确转化为可落地的评测方案
有良好的自驱力和学习能力,持续跟踪大模型与评测领域技术进展

工作职责

负责大模型通用能力及各专业垂类能力评测体系的建设与持续迭代,覆盖工程科学、数学、物理、化学、生物、医学、法律、金融、人文社科等核心方向,搭建科学、严谨、可复现的评测体系

围绕模型智能上限设计评测方案,通过高难度推理、复杂多步任务、长程规划等真实生产力任务检验模型的能力天花板,构建能有效区分模型能力层级的高区分度评测体系
深入分析模型在真实场景任务中的 bad case,精准归因问题来源(指令遵循失败、幻觉、上下文遗忘等),输出模型能力弱点分布图谱,为算法与训练团队提供可操作的优化方向与数据反馈
持续跟踪评测领域前沿方法,对现有评测基准进行充分调研与优缺点分析,建立评测数据的版本管理与防泄露机制,保障评测集的时效性与区分度
探索评测自动评估方案,研究主观评测新方法(如 LLM-as-Judge、对比评分、多维度量表等),将主观判断转化为可量化、可复现的评估指标,持续提升评测覆盖度与效率

优先资格

熟练掌握 Python,具备良好的工程编码习惯与数据处理能力,对大模型生产系统的工程设计有基本理解

了解 SFT、RLHF 等模型训练基本流程,能从学科评测角度为训练策略提供可操作的优化建议
有 LLM-as-Judge 或自动化评分系统的设计与实现经验,有评测数据合成、自动评估方案设计的实践
有多语言、跨文化学科评测的建设经验

AI 洞察

优缺点分析

优点

  • 身处大模型最前沿领域,能深度参与核心技术研发,积累尖端评测方法论,技术成长快
  • 阿里巴巴平台大、资源多,有顶尖算法团队和丰富落地场景,个人影响力可放大
  • 跨学科工作环境能拓宽知识视野,与各领域专家共事,人脉与专业知识双丰收
  • 大厂薪酬福利有竞争力,且该岗位定位核心,稳定性好
  • 评测工作需要极强细节把控和严谨性,分析bad case可能耗时耗力,工作强度不低
  • 需要持续跟踪快速变化的大模型技术,保持技术敏感度,否则容易落伍
  • 适合对AI有强烈好奇心、喜欢深钻技术、同时具备学科专长的复合型人才,尤其善于分析和解决复杂问题

缺点 / 挑战

  • 对综合能力要求高,既要懂技术又要具备深厚学科知识,学习压力大

角色解读

  • 在AI评测领域深耕,成为大模型质量保障与能力评估的专家,向技术专家或技术Leader方向发展
  • 通过深入理解模型训练与评测的闭环,可转岗至算法、数据科学或AI产品方向,拓宽职业路径
  • 随着大模型在各行业落地,评测能力愈发重要,有机会成为行业稀缺的评测架构师或标准制定者
  • 负责建设大模型评测体系,设计覆盖多学科的评测方案,确保模型能力评估的科学性和可复现性
  • 围绕模型能力上限设计高难度评测任务,如复杂推理、多步任务等,检验模型真实生产力
  • 深入分析模型bad case,定位问题根源,输出能力弱点图谱,为算法训练提供数据反馈
  • 跟踪前沿评测方法,探索LLM-as-Judge等自动评估技术,提升评测效率和覆盖度
  • 扎实的学科知识基础,至少在一个专业领域(如数学、法律、金融等)有深入理解,能设计专家级评测方案
  • 熟悉大模型推理流程和能力边界,了解主流评测集的设计思路与局限性
  • 具备跨领域沟通能力,能和算法、产品及各学科专家高效协作
  • 加分项要求Python编程能力,以及SFT/RLHF、LLM-as-Judge等实操经验

申请策略

  • 申请时展现对评测的热情和对细节的执着,可附上一份你熟悉的领域评测分析报告作为作品集
  • 了解阿里巴巴的大模型布局(如通义千问),并在面试中表达你的见解
  • 突出你在某个学科领域的专业深度,如发表过论文、做过相关项目等
  • 强调任何与评测相关的经历,如构建过数据集、设计过基准测试、做过模型评估分析
  • 展示编程能力,尤其是Python项目,以及数据处理和自动化脚本经验
  • 如果有大模型使用或微调经验,务必提及,特别是对模型输出质量的分析
  • 系统学习大模型基础概念(如Transformer、SFT、RLHF),了解模型训练流程对评测的影响
  • 动手尝试使用主流LLM API,设计简单评测任务,练习写评测代码和bad case分析

面试指南

  • 采用T-A-R框架:先讲任务背景(Task),再说明你的分析方法(Action),最后总结成果和影响(Result)
  • 对于评测设计问题,从目标定义、数据构建、指标选择、实验验证、迭代优化五步展开,体现系统性思维
  • 对于bad case分析,先分类问题(幻觉/指令遵循等),再归因,最后给优化建议,结构化表达
  • 如何设计一个针对法律领域的大模型评测集?你会考虑哪些维度和指标?
  • 当模型在数学推理任务上表现不佳时,你如何定位问题并给出改进建议?
  • 请对比几个主流大模型评测基准(如MMLU、GSM8K),分析它们的优缺点
  • 解释LLM-as-Judge的原理,并讨论它的可靠性和潜在缺陷
  • 如何保障评测数据的时效性和防泄露?请给出具体方案

职位点评

72
综合评分

头部大厂、前沿LLM评测赛道、技术成长极佳,但工作强度与生活平衡存在不确定性。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合看重技术成长和行业前景的求职者,愿意在快节奏大厂环境中挑战前沿问题。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值70

薪资福利

75中等

阿里巴巴大厂平台,薪资水平在业内具有竞争力,虽未具体披露,但隐形福利完善,综合保障较好。

薪资信号未披露(AI估算:30K-55K/月)

成长发展

85较高

岗位处于大模型评测前沿,技术挑战高,能积累稀缺评测方法论,成长空间大。

技术前沿前沿/新兴技术
技术栈LLM、大模型评测、Python、LLM-as-Judge、机器学习、推理能力
成长机会持续跟踪评测领域前沿方法
业务类型ambiguous

工作生活

50较低

北京/杭州一线城市,大厂工作节奏较快,JD未提及弹性办公或加班情况,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

大模型是影响未来社会的核心技术,评测工作为AI安全与能力提升做保障,具有一定社会意义。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs