Ant Group logo
蚂蚁集团
蚂蚁集团-大模型算法专家-模型评测-北京/杭州【AGI专项】

蚂蚁集团-大模型算法专家-模型评测-北京/杭州【AGI专项】

发布于 大约 8 小时前

普通员工/个人贡献者

北京市 / 杭州市
专家级经验
全职员工
仅现场办公
硕士
机器学习工程
Aigc
Nlp
后训练
大模型评测
机器学习
深度思考
预训练

AI 估算 · 35k–60k

大模型方向热门,蚂蚁集团薪资竞争力强,算法专家级别薪酬较高

职位详情

关于这个职位

该职位负责蚂蚁集团语言大模型的评测算法研究与体系建设,需搭建业界领先的评测体系,精准评估大模型能力

工作涉及利用AIGC技术构建高质量评测数据集,结合公开Benchmark,深入大模型各训练阶段,通过高效评测提升模型能力与用户体验
适合具备扎实机器学习基础、熟悉大模型且有较强工程能力的求职者

最低要求

硕士及以上学历,计算机科学、人工智能、软件工程、数学等相关专业

具备扎实的机器学习算法基础,熟悉语言大模型的基本理论和算法
具备扎实的工程能力,熟练掌握Python编程,能高效进行代码开发和调试
具有良好的学习和沟通能力,有好奇心和责任心,具有钻研精神

工作职责

负责蚂蚁集团语言大模型的评测算法研究与应用,搭建业界领先的大模型评测体系,精准全面地评估大模型的能力

基于AIGC等技术建设高质量评测数据集,与业界公开评测集有机结合,深入大模型预训练、后训练、深度思考等各个阶段,利用大模型等技术提高评测效率和准确性,通过高效高质量评测提升语言大模型、垂域大模型的能力和用户体验

优先资格

具有大模型评测等相关经验,熟悉常见的大模型评测Benchmark和评测方法优先

在NeurIPS、ICML、ICLR、KDD、SIGIR等国际顶会发表过论文优先

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台大,资源丰富,能够接触大规模实际业务场景和顶级计算资源
  • 大模型领域处于高速发展期,评测方向具有高技术壁垒和长期价值
  • 团队技术氛围浓厚,有机会与行业顶尖专家合作,并参与顶级会议论文发表
  • 大模型评测标准仍在演进,需要持续跟踪前沿研究并快速迭代方法论
  • 对综合能力要求高,不仅需要算法深度,还需要较强的工程与沟通能力

缺点 / 挑战

  • 薪资和福利具有竞争力,大厂稳定性较高
  • 工作强度可能较高,尤其是在模型迭代关键期需要深度投入
  • 适合对大模型技术有浓厚兴趣、具备扎实算法和工程能力、喜欢挑战性研究工作的求职者

角色解读

  • 纵向发展:从评测专家进阶为大模型算法负责人,主导模型评估与优化策略
  • 横向拓展:转向大模型训练、推理或应用方向,成为全栈大模型算法专家
  • 行业机会:随着大模型在各行各业落地,评测专家可成为AI质量保障领域的稀缺人才
  • 设计和构建大模型评测体系,制定评测标准与流程,确保评估的全面性和准确性
  • 开发基于AIGC的自动化评测数据集生成工具,提升评测数据的质量和覆盖度
  • 深入分析模型在各训练阶段的表现,与算法团队协作定位问题,推动模型能力提升
  • 跟踪前沿评测方法,将公开Benchmark与内部评测相结合,持续优化评测技术
  • 扎实的机器学习基础和深度学习理论,熟悉Transformer、预训练、RLHF等大模型技术
  • 熟练掌握Python及常用深度学习框架(如PyTorch),具备高效工程实现能力
  • 了解大模型评测常用Benchmark(如MMLU、HumanEval、GSM8K等)及评测方法论
  • 具备较强的数据分析与实验设计能力,能够设计和执行对比实验并解读结果

申请策略

  • 提前了解蚂蚁集团的大模型战略和已有产品(如蚂蚁百灵),在面试中展示对业务的理解
  • 准备好一个完整的项目案例,展示从问题定义、实验设计到结论输出的全流程
  • 突出大模型相关项目经验,尤其是涉及模型评测、评估或对比分析的工作
  • 展示对常用Benchmark的熟悉程度,以及自己设计的评测方案或工具
  • 强调学术成果(顶会论文)和开源贡献,体现研究能力和影响力
  • 详细描述工程能力,如使用Python开发评测框架、数据处理管线等
  • 系统学习大模型评测领域的最新成果,如LLM-as-Judge、自动化评测等方向
  • 动手实践主流的开源大模型评测工具(如lm-evaluation-harness、OpenCompass等)

面试指南

  • STAR法则:描述情境、任务、行动、结果,重点展示你的思考过程和权衡取舍
  • 对比分析:在讨论评测方法时,主动对比不同方法的优缺点,展示全局视野
  • 数据驱动:强调用数据和实验说话,量化指标和效果,避免空泛论述
  • 请介绍你参与过的某个大模型评测项目,包括评测指标、数据集构建及结论
  • 如何看待当前主流评测Benchmark的局限性?如何设计更有效的评测方法?
  • 如何评估一个语言模型在特定垂域(如金融)的能力?需要哪些步骤和数据?
  • 你熟悉哪些大模型训练技术(如RLHF、DPO),如何设计评测指标来评估这些技术带来的效果提升?
  • 给定一个模型生成的回答集合,如何自动化评测其质量和安全性?

职位点评

71
综合评分

大厂大模型评测岗,技术前沿、薪资优厚,但WLB一般,适合技术驱动型求职者。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长、愿意接受高强度工作、对大模型前沿有强烈兴趣的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活40
使命价值65

薪资福利

75中等

蚂蚁集团作为互联网大厂,薪资待遇属于市场偏高水平,但JD未明确薪资和福利细节,补偿性动机满足程度较好。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

90较高

该职位专注于前沿大模型技术,技术栈先进,且有顶会论文要求,成长空间大,发展性动机满足程度很高。

技术前沿前沿/新兴技术
技术栈大模型评测、AIGC、预训练、后训练、深度思考、Python、Benchmark
业务类型ambiguous

工作生活

40较低

JD仅提到北京/杭州办公,未提及弹性工作或远程选项,互联网大厂工作节奏可能较快,生活化动机满足有限。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

大模型方向属于高速增长赛道,但评测岗位主要支撑内部模型研发,社会影响力有限,意义感动机中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs