Ant Group logo
蚂蚁集团
蚂蚁集团-大模型 Benchmark 与评测体系工程师 / 专家-杭州/北京

蚂蚁集团-大模型 Benchmark 与评测体系工程师 / 专家-杭州/北京

发布于 大约 3 小时前

普通员工/个人贡献者

北京市 / 杭州市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Agent评测
Llm评测
Pytorch
Rlhf/Dpo
多模态
数据标注
自动化评测
对抗性分析

AI 估算 · 35k–65k

大模型评测方向稀缺度高,蚂蚁平台技术优势,薪资处于行业头部水平。

职位详情

关于这个职位

该职位负责蚂蚁集团大模型评测体系的设计与落地,包括Benchmark建设、评测自动化、前沿评测范式探索等

你需要通过对抗性分析定位金融、医疗等场景的模型短板,推动“评测-反馈-优化”闭环,并主导评测数据资产与平台化能力建设
适合对大模型评测有深入兴趣、具备扎实AI功底和工程化能力的候选人

最低要求

● 计算机、人工智能、数学等相关专业,研究生及以上学历优先

3年以上AI/NLP/模型评测相关经验,至少1年大模型相关项目经验
● 优秀的数据敏感度与逻辑分析能力,能从复杂数据中定位关键问题并给出可落地方案
● 深入理解大模型全链路:训练、推理、微调、评估与对齐
● 扎实的Python与算法基础,熟悉PyTorch等主流深度学习框架
具备良好的工程化能力
● 强烈技术好奇心、自我驱动力
跨团队沟通协作能力强,适应高频迭代节奏

工作职责

评测洞察与缺陷定位:基于对抗性分析、错误归因、能力边界挖掘等方法,系统定位模型在金融、医疗等场景的核心短板,推动形成“评测-反馈-优化”的技术闭环

前沿评测范式探索:追踪全球前沿Benchmark与评估技术,研究RLHF/DPO等对齐数据驱动的新评估范式,探索仿真环境、Agent链路评测等新方法,保持技术领先
评测体系设计与平台化落地:主导设计数据驱动的LLM/多模态/Agent评测体系,建设自动化评测分析能力,支持在平台上完成评测任务的适配、调度与规模化分析
Benchmark与数据资产建设:负责评测数据采集、清洗、标注、版本管理与标准制定,构建高质量、多样化的Benchmark资产:
○ 金融领域:构建并落地多个覆盖金融知识、推理、合规性的专业评测基准,并完成在平台上的自动化适配与调度
○ 医疗领域:针对个性化、专业人设、共情能力、长程记忆等高阶交互能力,产出多个创新评测基准,定义下一代智能健康助手的评估标准
快速迭代与工程协同:面向模型快速迭代节奏,提升评测链路自动化与迭代效率,支撑多团队、多模型、多版本的高频评测与回归

优先资格

● 主导或核心参与过业界知名的开源评测项目或 Benchmark 建设

● 拥有丰富的大模型微调(SFT/RLHF/DPO)或复杂应用落地项目经验
● 在 NeurIPS、ICML、ACL、EMNLP 等相关顶会发表过高质量论文

AI 洞察

优缺点分析

优点

  • 处于大模型核心赛道,评测是保证模型质量的关键环节,技术含金量高
  • 蚂蚁集团提供丰富的金融、医疗场景数据和应用落地机会,业务价值明确
  • 可接触前沿技术(RLHF/DPO、Agent评测等)并参与行业标准制定
  • 平台资源雄厚,团队技术氛围浓厚,有利于个人快速成长
  • 评测体系设计复杂,涉及多模态、Agent等新方向,需要持续学习和探索
  • 适合对AI评测有热情、技术扎实、自驱力强,且能适应快节奏的技术型人才

缺点 / 挑战

  • 需要高频迭代和快速响应,工作节奏可能较快,压力较大
  • 跨团队协作频繁,对沟通和推动能力要求较高

角色解读

  • 在AI评测领域深耕,成为大模型质量保障与评估方向的专家
  • 可向算法研发、模型训练或AI平台架构方向拓展,积累全栈能力
  • 有机会主导行业级Benchmark建设,提升在学术界和工业界的影响力
  • 设计并落地大模型评测体系,包括基准测试、自动化评测链路和平台化能力,支撑多模型高频迭代
  • 通过对抗性分析、错误归因等方法定位模型在金融、医疗等垂直领域的能力短板,并推动优化闭环
  • 探索前沿评测范式,如基于RLHF/DPO的对齐评估、仿真环境、Agent链路评测等,保持技术领先
  • 建设高质量Benchmark数据资产,包括数据采集、清洗、标注、版本管理和标准制定
  • 扎实的Python与算法基础,熟悉PyTorch等深度学习框架,具备工程化落地能力
  • 深入理解大模型全链路,包括训练、推理、微调、评估与对齐,有实际项目经验
  • 优秀的数据敏感度和逻辑分析能力,能通过数据洞察定位复杂问题
  • 熟悉NLP/LLM前沿技术,对Benchmark和评测方法论有系统认知

申请策略

  • 提前了解蚂蚁集团在金融、医疗领域的AI产品,思考评测如何支撑业务
  • 关注团队的技术博客或开源项目,在面试中展示对评测技术的深度思考
  • 突出大模型相关项目经验,特别是评测、评估、Benchmark建设的实际成果
  • 强调Python、PyTorch、数据处理和算法调优能力,附上量化结果
  • 如有开源评测项目或顶会论文,务必重点呈现
  • 展示对金融或医疗领域评测难点理解,体现业务敏感度
  • 系统学习RLHF/DPO等对齐方法,并动手实践模型微调和评估
  • 熟悉主流Benchmark(如MMLU、GLUE、SuperGLUE)的设计思路和优劣

面试指南

  • 回答评测设计时,注意覆盖数据构建、评估指标、任务类型和基线对比,强调与业务场景的结合
  • 面对问题排查类问题,采用“假设-验证-归因”的思路,先定位可能原因,再设计实验验证,最后给出优化建议
  • 对开放性探索题,展示技术视野,结合前沿工作和实际经验,提出可行方案
  • 如何设计一个针对金融领域的大模型评测基准?请说明具体维度和数据来源
  • 如何评估一个Agent系统的能力?与普通LLM评测有何不同?
  • 如果模型在某个评测集上分数很高,但实际业务表现差,如何排查和改进?
  • 你对RLHF/DPO如何影响评测范式有什么理解?
  • 如何建设高效的自动化评测平台,支撑多模型高频迭代?

职位点评

68
综合评分

大厂前沿方向、技术含量高、成长快,但工作强度大、生活平衡一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长与前沿探索、能够接受高强度工作节奏的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展92
工作生活35
使命价值62

薪资福利

70中等

薪资未明确披露,但蚂蚁集团作为头部互联网平台,薪酬竞争力强,属于市场偏上水平。

薪资信号未披露(AI估算:35K-65K/月)

成长发展

92较高

大模型评测是前沿技术方向,涉及Benchmark建设、自动化平台和前沿范式探索,成长空间广阔,技能积累价值高。

技术前沿前沿/新兴技术
技术栈Benchmark、LLM、RLHF/DPO、PyTorch、Agent、多模态
业务类型ambiguous

工作生活

35较低

仅现场办公,工作节奏要求高频迭代,可能面临较大加班压力,工作生活平衡性较弱。

工作模式仅现场办公
办公地点未明确
加班情况JD含高强度暗示词

使命价值

62中等

大模型评测对金融、医疗等有正向社会价值,但JD未强调使命感,行业前瞻性强但意义感一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs