
蚂蚁集团
蚂蚁集团-大模型 Benchmark 与评测体系工程师 / 专家-杭州/北京
蚂蚁集团-大模型 Benchmark 与评测体系工程师 / 专家-杭州/北京
发布于 大约 3 小时前普通员工/个人贡献者
北京市 / 杭州市
高级经验
全职员工
仅现场办公
硕士
机器学习工程
Agent评测
Llm评测
Pytorch
Rlhf/Dpo
多模态
数据标注
自动化评测
对抗性分析
AI 估算 · 35k–65k
大模型评测方向稀缺度高,蚂蚁平台技术优势,薪资处于行业头部水平。
职位详情
关于这个职位
该职位负责蚂蚁集团大模型评测体系的设计与落地,包括Benchmark建设、评测自动化、前沿评测范式探索等
你需要通过对抗性分析定位金融、医疗等场景的模型短板,推动“评测-反馈-优化”闭环,并主导评测数据资产与平台化能力建设
适合对大模型评测有深入兴趣、具备扎实AI功底和工程化能力的候选人
最低要求
● 计算机、人工智能、数学等相关专业,研究生及以上学历优先
● 3年以上AI/NLP/模型评测相关经验,至少1年大模型相关项目经验
● 优秀的数据敏感度与逻辑分析能力,能从复杂数据中定位关键问题并给出可落地方案
● 深入理解大模型全链路:训练、推理、微调、评估与对齐
● 扎实的Python与算法基础,熟悉PyTorch等主流深度学习框架
具备良好的工程化能力
● 强烈技术好奇心、自我驱动力
跨团队沟通协作能力强,适应高频迭代节奏
工作职责
评测洞察与缺陷定位:基于对抗性分析、错误归因、能力边界挖掘等方法,系统定位模型在金融、医疗等场景的核心短板,推动形成“评测-反馈-优化”的技术闭环
前沿评测范式探索:追踪全球前沿Benchmark与评估技术,研究RLHF/DPO等对齐数据驱动的新评估范式,探索仿真环境、Agent链路评测等新方法,保持技术领先
评测体系设计与平台化落地:主导设计数据驱动的LLM/多模态/Agent评测体系,建设自动化评测分析能力,支持在平台上完成评测任务的适配、调度与规模化分析
Benchmark与数据资产建设:负责评测数据采集、清洗、标注、版本管理与标准制定,构建高质量、多样化的Benchmark资产:
○ 金融领域:构建并落地多个覆盖金融知识、推理、合规性的专业评测基准,并完成在平台上的自动化适配与调度
○ 医疗领域:针对个性化、专业人设、共情能力、长程记忆等高阶交互能力,产出多个创新评测基准,定义下一代智能健康助手的评估标准
快速迭代与工程协同:面向模型快速迭代节奏,提升评测链路自动化与迭代效率,支撑多团队、多模型、多版本的高频评测与回归
优先资格
● 主导或核心参与过业界知名的开源评测项目或 Benchmark 建设
● 拥有丰富的大模型微调(SFT/RLHF/DPO)或复杂应用落地项目经验
● 在 NeurIPS、ICML、ACL、EMNLP 等相关顶会发表过高质量论文
AI 洞察
优缺点分析
优点
- 处于大模型核心赛道,评测是保证模型质量的关键环节,技术含金量高
- 蚂蚁集团提供丰富的金融、医疗场景数据和应用落地机会,业务价值明确
- 可接触前沿技术(RLHF/DPO、Agent评测等)并参与行业标准制定
- 平台资源雄厚,团队技术氛围浓厚,有利于个人快速成长
- 评测体系设计复杂,涉及多模态、Agent等新方向,需要持续学习和探索
- 适合对AI评测有热情、技术扎实、自驱力强,且能适应快节奏的技术型人才
缺点 / 挑战
- 需要高频迭代和快速响应,工作节奏可能较快,压力较大
- 跨团队协作频繁,对沟通和推动能力要求较高
角色解读
- 在AI评测领域深耕,成为大模型质量保障与评估方向的专家
- 可向算法研发、模型训练或AI平台架构方向拓展,积累全栈能力
- 有机会主导行业级Benchmark建设,提升在学术界和工业界的影响力
- 设计并落地大模型评测体系,包括基准测试、自动化评测链路和平台化能力,支撑多模型高频迭代
- 通过对抗性分析、错误归因等方法定位模型在金融、医疗等垂直领域的能力短板,并推动优化闭环
- 探索前沿评测范式,如基于RLHF/DPO的对齐评估、仿真环境、Agent链路评测等,保持技术领先
- 建设高质量Benchmark数据资产,包括数据采集、清洗、标注、版本管理和标准制定
- 扎实的Python与算法基础,熟悉PyTorch等深度学习框架,具备工程化落地能力
- 深入理解大模型全链路,包括训练、推理、微调、评估与对齐,有实际项目经验
- 优秀的数据敏感度和逻辑分析能力,能通过数据洞察定位复杂问题
- 熟悉NLP/LLM前沿技术,对Benchmark和评测方法论有系统认知
申请策略
- 提前了解蚂蚁集团在金融、医疗领域的AI产品,思考评测如何支撑业务
- 关注团队的技术博客或开源项目,在面试中展示对评测技术的深度思考
- 突出大模型相关项目经验,特别是评测、评估、Benchmark建设的实际成果
- 强调Python、PyTorch、数据处理和算法调优能力,附上量化结果
- 如有开源评测项目或顶会论文,务必重点呈现
- 展示对金融或医疗领域评测难点理解,体现业务敏感度
- 系统学习RLHF/DPO等对齐方法,并动手实践模型微调和评估
- 熟悉主流Benchmark(如MMLU、GLUE、SuperGLUE)的设计思路和优劣
面试指南
- 回答评测设计时,注意覆盖数据构建、评估指标、任务类型和基线对比,强调与业务场景的结合
- 面对问题排查类问题,采用“假设-验证-归因”的思路,先定位可能原因,再设计实验验证,最后给出优化建议
- 对开放性探索题,展示技术视野,结合前沿工作和实际经验,提出可行方案
- 如何设计一个针对金融领域的大模型评测基准?请说明具体维度和数据来源
- 如何评估一个Agent系统的能力?与普通LLM评测有何不同?
- 如果模型在某个评测集上分数很高,但实际业务表现差,如何排查和改进?
- 你对RLHF/DPO如何影响评测范式有什么理解?
- 如何建设高效的自动化评测平台,支撑多模型高频迭代?
职位点评
68
综合评分
大厂前沿方向、技术含量高、成长快,但工作强度大、生活平衡一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长与前沿探索、能够接受高强度工作节奏的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展92
工作生活35
使命价值62
薪资福利
70中等
薪资未明确披露,但蚂蚁集团作为头部互联网平台,薪酬竞争力强,属于市场偏上水平。
薪资信号未披露(AI估算:35K-65K/月)
成长发展
92较高
大模型评测是前沿技术方向,涉及Benchmark建设、自动化平台和前沿范式探索,成长空间广阔,技能积累价值高。
技术前沿前沿/新兴技术
技术栈Benchmark、LLM、RLHF/DPO、PyTorch、Agent、多模态
业务类型ambiguous
工作生活
35较低
仅现场办公,工作节奏要求高频迭代,可能面临较大加班压力,工作生活平衡性较弱。
工作模式仅现场办公
办公地点未明确
加班情况JD含高强度暗示词
使命价值
62中等
大模型评测对金融、医疗等有正向社会价值,但JD未强调使命感,行业前瞻性强但意义感一般。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs