
阿里巴巴
数据技术及产品部-LLM评测专家-通用及垂类方向
数据技术及产品部-LLM评测专家-通用及垂类方向
发布于 大约 14 小时前普通员工/个人贡献者
北京市 / 杭州市
中级经验
全职员工
仅现场办公
本科
机器学习工程
Llm
Llm-As-Judge
大模型评测
推理能力
数据分析
机器学习
评测体系
AI 估算 · 30k–55k
大厂核心算法岗,LLM方向稀缺,薪资竞争力强,通常含16薪。
职位详情
关于这个职位
这是一份负责大模型评测体系建设的专业职位,你将在阿里巴巴数据技术及产品部深入探索LLM的能力边界,设计并迭代覆盖多学科的评测方案
你会与顶尖算法工程师、各领域专家紧密协作,分析模型bad case,推动大模型不断进化
如果你对大模型底层能力充满好奇,希望在AI浪潮中扮演质量守门人的角色,这个职位将提供广阔平台
最低要求
本科及以上学历,工程科学、数学、物理、化学、生物、医学、语言学、文学、法律、金融、心理学或相关学科专业优先
具备良好的学科知识素养,至少在一个学科领域(工程科学/自然科学/医学/法律/金融等)有较深入的理解,能够提供专家级的评测方案
对大模型的推理流程、能力边界有基本认知,了解主流学科评测集的设计思路与局限性,有实际构建或深度分析过至少一个领域评测集的经验优先
较强的跨领域沟通能力与团队协作意识,能与不同学科背景的研究人员、算法团队及外部专家高效配合,将学科需求准确转化为可落地的评测方案
有良好的自驱力和学习能力,持续跟踪大模型与评测领域技术进展
工作职责
负责大模型通用能力及各专业垂类能力评测体系的建设与持续迭代,覆盖工程科学、数学、物理、化学、生物、医学、法律、金融、人文社科等核心方向,搭建科学、严谨、可复现的评测体系
围绕模型智能上限设计评测方案,通过高难度推理、复杂多步任务、长程规划等真实生产力任务检验模型的能力天花板,构建能有效区分模型能力层级的高区分度评测体系
深入分析模型在真实场景任务中的 bad case,精准归因问题来源(指令遵循失败、幻觉、上下文遗忘等),输出模型能力弱点分布图谱,为算法与训练团队提供可操作的优化方向与数据反馈
持续跟踪评测领域前沿方法,对现有评测基准进行充分调研与优缺点分析,建立评测数据的版本管理与防泄露机制,保障评测集的时效性与区分度
探索评测自动评估方案,研究主观评测新方法(如 LLM-as-Judge、对比评分、多维度量表等),将主观判断转化为可量化、可复现的评估指标,持续提升评测覆盖度与效率
优先资格
熟练掌握 Python,具备良好的工程编码习惯与数据处理能力,对大模型生产系统的工程设计有基本理解
了解 SFT、RLHF 等模型训练基本流程,能从学科评测角度为训练策略提供可操作的优化建议
有 LLM-as-Judge 或自动化评分系统的设计与实现经验,有评测数据合成、自动评估方案设计的实践
有多语言、跨文化学科评测的建设经验
AI 洞察
优缺点分析
优点
- 身处大模型最前沿领域,能深度参与核心技术研发,积累尖端评测方法论,技术成长快
- 阿里巴巴平台大、资源多,有顶尖算法团队和丰富落地场景,个人影响力可放大
- 跨学科工作环境能拓宽知识视野,与各领域专家共事,人脉与专业知识双丰收
- 大厂薪酬福利有竞争力,且该岗位定位核心,稳定性好
- 评测工作需要极强细节把控和严谨性,分析bad case可能耗时耗力,工作强度不低
- 需要持续跟踪快速变化的大模型技术,保持技术敏感度,否则容易落伍
- 适合对AI有强烈好奇心、喜欢深钻技术、同时具备学科专长的复合型人才,尤其善于分析和解决复杂问题
缺点 / 挑战
- 对综合能力要求高,既要懂技术又要具备深厚学科知识,学习压力大
角色解读
- 在AI评测领域深耕,成为大模型质量保障与能力评估的专家,向技术专家或技术Leader方向发展
- 通过深入理解模型训练与评测的闭环,可转岗至算法、数据科学或AI产品方向,拓宽职业路径
- 随着大模型在各行业落地,评测能力愈发重要,有机会成为行业稀缺的评测架构师或标准制定者
- 负责建设大模型评测体系,设计覆盖多学科的评测方案,确保模型能力评估的科学性和可复现性
- 围绕模型能力上限设计高难度评测任务,如复杂推理、多步任务等,检验模型真实生产力
- 深入分析模型bad case,定位问题根源,输出能力弱点图谱,为算法训练提供数据反馈
- 跟踪前沿评测方法,探索LLM-as-Judge等自动评估技术,提升评测效率和覆盖度
- 扎实的学科知识基础,至少在一个专业领域(如数学、法律、金融等)有深入理解,能设计专家级评测方案
- 熟悉大模型推理流程和能力边界,了解主流评测集的设计思路与局限性
- 具备跨领域沟通能力,能和算法、产品及各学科专家高效协作
- 加分项要求Python编程能力,以及SFT/RLHF、LLM-as-Judge等实操经验
申请策略
- 申请时展现对评测的热情和对细节的执着,可附上一份你熟悉的领域评测分析报告作为作品集
- 了解阿里巴巴的大模型布局(如通义千问),并在面试中表达你的见解
- 突出你在某个学科领域的专业深度,如发表过论文、做过相关项目等
- 强调任何与评测相关的经历,如构建过数据集、设计过基准测试、做过模型评估分析
- 展示编程能力,尤其是Python项目,以及数据处理和自动化脚本经验
- 如果有大模型使用或微调经验,务必提及,特别是对模型输出质量的分析
- 系统学习大模型基础概念(如Transformer、SFT、RLHF),了解模型训练流程对评测的影响
- 动手尝试使用主流LLM API,设计简单评测任务,练习写评测代码和bad case分析
面试指南
- 采用T-A-R框架:先讲任务背景(Task),再说明你的分析方法(Action),最后总结成果和影响(Result)
- 对于评测设计问题,从目标定义、数据构建、指标选择、实验验证、迭代优化五步展开,体现系统性思维
- 对于bad case分析,先分类问题(幻觉/指令遵循等),再归因,最后给优化建议,结构化表达
- 如何设计一个针对法律领域的大模型评测集?你会考虑哪些维度和指标?
- 当模型在数学推理任务上表现不佳时,你如何定位问题并给出改进建议?
- 请对比几个主流大模型评测基准(如MMLU、GSM8K),分析它们的优缺点
- 解释LLM-as-Judge的原理,并讨论它的可靠性和潜在缺陷
- 如何保障评测数据的时效性和防泄露?请给出具体方案
职位点评
72
综合评分
头部大厂、前沿LLM评测赛道、技术成长极佳,但工作强度与生活平衡存在不确定性。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合看重技术成长和行业前景的求职者,愿意在快节奏大厂环境中挑战前沿问题。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值70
薪资福利
75中等
阿里巴巴大厂平台,薪资水平在业内具有竞争力,虽未具体披露,但隐形福利完善,综合保障较好。
薪资信号未披露(AI估算:30K-55K/月)
成长发展
85较高
岗位处于大模型评测前沿,技术挑战高,能积累稀缺评测方法论,成长空间大。
技术前沿前沿/新兴技术
技术栈LLM、大模型评测、Python、LLM-as-Judge、机器学习、推理能力
成长机会持续跟踪评测领域前沿方法
业务类型ambiguous
工作生活
50较低
北京/杭州一线城市,大厂工作节奏较快,JD未提及弹性办公或加班情况,生活平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
大模型是影响未来社会的核心技术,评测工作为AI安全与能力提升做保障,具有一定社会意义。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs