
蚂蚁集团
蚂蚁集团-大模型评测专家-杭州/北京
蚂蚁集团-大模型评测专家-杭州/北京
发布于 1 天前普通员工/个人贡献者
北京市 / 杭州市
中级经验
全职员工
仅现场办公
本科
机器学习工程
Agent评估
Llm
Nlp
Pytorch
Vlm
多模态
大模型评测
评测体系
AI 估算 · 40k–70k
大模型评测前沿方向,蚂蚁平台,资深岗位,一线互联网薪资水平,结合城市与职责综合估算。
职位详情
关于这个职位
本职位负责蚂蚁集团大模型及AI产品的评测体系建设,包括Benchmark设计、多模态生成和Agent评估等前沿方向
你将参与评测方案设计、自动化工程化以及Bad Case分析,为算法优化提供关键结论
适合有NLP或大模型经验、对评测有热情的技术专家
最低要求
计算机、人工智能、数学、统计等相关专业,本科及以上,硕士优先
年以上大模型评测、NLP 算法或 AI 工程相关经验
在多模态生成评测、Agent 评估体系、LLM 评测体系三个方向中至少深入掌握一个,具备从 0 到 1 设计评测方案的能力(定义维度、建数据集、选方法)
扎实的工程能力:熟练 Python,能独立完成评测框架开发与数据分析
了解 PyTorch 等深度学习框架
理解大模型全链路(预训练/SFT/RLHF/DPO/推理)
优秀的数据敏感度,能从复杂数据中定位关键问题,输出有优先级的可落地结论
具备良好的跨团队沟通和项目推动能力
工作职责
全场景评测体系建设
负责大模型及 AI 产品的 Benchmark 建设、评测方案设计与持续迭代
覆盖对话、图像理解、语音、多模态生成、Agent 等场景,设计科学合理的评测维度与指标体系
结合竞品分析,为产品和算法优化提供有判断的结论与建议
*重点方向专项深耕和探索
多模态生成:生图/生视频/实时生成/世界模型方向的专项 Benchmark 设计,引入 VLM 视觉评分(参考 VBench、EvalCrafter),结合视觉审美与生成技术理解,系统对比 Sora、Kling 等竞品
Agent 评估:为闪应用/闪游戏/异步任务构建覆盖行为轨迹全过程的多层次评估体系,引入过程奖励模型(PRM)、Checklist Reward 等方法,搭建 Playwright + 沙箱自动化评估 harness
评估框架:推动动态多轮评估、Agentic 评估、流式化链路等前沿方法落地,设计跨场景统一评估架构,建立 meta-evaluation 机制,推动评测-训练闭环
工程化与效果诊断
推动评测链路自动化,支持多模型/多版本高频回归
基于 Bad Case 分析定位模型核心短板,将评测结论转化为可落地的优化方向,跟踪业界前沿评测方法持续升级评测体系
优先资格
加分项
熟悉主流 Benchmark:VBench、SWE-bench、WebArena、MMMU、HELM、lm-evaluation-harness 等
有 Playwright + VLM 自动化评测实践,或 Agent 评估 harness 搭建经验
主导或核心参与过开源评测项目或 Benchmark 建设
有大模型微调(SFT/RLHF/DPO)或复杂 Agent 应用落地经验
在 NeurIPS、ICML、ACL、EMNLP、ICLR 等顶会发表过论文
AI 洞察
优缺点分析
优点
- 站在AI技术前沿,接触大模型评测的最新方法,技能积累快
- 工作涉及多模态、Agent等热门方向,赛道发展前景广阔
- 蚂蚁集团平台大,资源丰富,影响力广泛,利于职业背书
- 职责兼具技术与工程,能锻炼系统设计能力和业务判断力
- 评测领域尚不成熟,需要自己探索方法论,对创新能力和自驱力要求高
- 工作涉及多个复杂场景,需要同时掌握算法、工程和产品理解,学习曲线陡峭
- 适合对大模型技术有热情、喜欢钻研评测方法论、具备扎实工程能力并乐于解决复杂问题的技术型人才
缺点 / 挑战
- 需要与算法、产品、工程等多团队协作,对沟通推动能力有较高要求
角色解读
- 在AI评测这一新兴领域深耕,成为评测方法论专家,引领行业标准制定
- 可向大模型算法或AI产品方向横向发展,评测经验有助于深入理解模型能力与瓶颈
- 在蚂蚁集团这样的平台,有机会接触前沿技术和核心业务,晋升技术专家或团队负责人
- 设计并迭代大模型及AI产品的评测体系,覆盖对话、图像理解、多模态生成、Agent等场景,制定评测维度和指标
- 深入多模态生成和Agent评估两个重点方向,构建专项Benchmark,引入VLM视觉评分、过程奖励模型等方法
- 推动评测链路自动化,开发评测框架,进行Bad Case分析并输出优化建议,支持多模型高频回归
- 扎实的Python编程能力,能独立开发评测框架并进行数据分析,熟悉PyTorch等深度学习框架
- 深入掌握多模态生成评测、Agent评估体系或LLM评测体系中的至少一个方向,具备从0到1设计评测方案的能力
- 理解大模型预训练/SFT/RLHF/DPO/推理全链路,对主流Benchmark(如VBench、SWE-bench、WebArena)有了解
- 优秀的数据敏感度和跨团队沟通能力,能将复杂数据转化为可落地的结论
申请策略
- 在简历中明确写出你如何设计评测维度、选择指标及影响模型优化结果
- 提前了解蚂蚁集团在AI领域的布局和产品线,面试中展示对业务场景的理解
- 突出大模型或NLP相关项目经验,尤其是评测方案设计、数据集构建或Benchmark优化的实际案例
- 强调Python工程能力,如有评测框架开发、自动化测试或数据分析项目,要详细描述
- 如果有涉及多模态生成或Agent评估的经验,务必展示具体方法和成果
- 提及开源贡献或顶会论文,如相关评测方向的研究,会增加竞争力
- 熟悉主流Benchmark工具,如lm-evaluation-harness、VBench、WebArena等,并实践运行
- 补充学习Playwright自动化测试、沙箱环境搭建,以及VLM视觉评分相关的技术
面试指南
- 使用STAR法则:说明情境、任务、行动和结果,强调你的思考过程和量化成果
- 体现系统性思维:从评测目标、维度设计、数据构建、方法选择到工程实现,全链路阐述
- 展示学习能力:提及你如何跟踪前沿评测方法并快速实践,体现成长性
- 请讲述一次你设计评测方案的经历,如何定义评测维度和指标?
- 在大模型评测中,你是如何处理Bad Case并推动优化的?
- 如何评估一个多模态生成模型(如文生视频)的质量?你会设计哪些评测项?
- Agent评估与传统的LLM评估有何不同?你会如何搭建评估框架?
- 你了解哪些主流Benchmark?它们的优缺点是什么?
职位点评
72
综合评分
前沿大模型评测专家,技术成长极佳,薪资竞争力强但加班情况未知。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
这个职位最适合重视技术成长、追求前沿创新,同时能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活45
使命价值60
薪资福利
75中等
薪资未披露,但蚂蚁集团作为头部互联网公司,薪酬水平通常具有竞争力,同时提供完善的福利体系。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
95较高
职位处于大模型评测前沿领域,涉及多模态、Agent等新技术,并能深度参与评测方法论创新,成长空间很大。
技术前沿前沿/新兴技术
技术栈大模型、Benchmark、多模态、Agent、Python、PyTorch、LLM、VLM
业务类型ambiguous
工作生活
45较低
工作地点杭州/北京,未提及远程或弹性工作,可能面临互联网公司常见的工作压力,生活平衡一般。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
大模型评测对行业有重要价值,但岗位更偏技术和工程,社会影响力间接且有限。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs