
蚂蚁集团
蚂蚁集团-Agent 评测工程师-AI创新产品
蚂蚁集团-Agent 评测工程师-AI创新产品
发布于 大约 14 小时前普通员工/个人贡献者
上海市 / 杭州市
中级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Go
Llm-As-A-Judge
分布式系统
大语言模型
数据管道
智能体评测
AI 估算 · 35k–55k
AI大厂核心方向,技能要求高,薪资有竞争力,参考行业水平估算。
职位详情
关于这个职位
作为蚂蚁集团AI创新产品的Agent评测工程师,你将负责设计智能体评测任务,覆盖工具调用、多智能体协作等前沿方向
你需要构建可扩展的评测流水线和监控体系,将模型行为问题转化为可验证的实验,持续推动模型与产品优化
适合对LLM和智能体技术有深入理解、擅长工程实现和数据分析的候选人
最低要求
具备扎实的软件工程、计算机系统、机器学习、统计学或相关领域基础
熟练掌握 Python、Go、Node.js 或其他至少一种编程语言,具备良好的工程开发、系统设计和问题排查能力
熟悉大语言模型及智能体技术,具备以下一个或多个方向的实际经验:大模型评测与 Benchmark、LLM-as-a-Judge 或自动评分器、评测数据集或合成数据构建、工具调用型智能体、多智能体工作流、长上下文或长周期任务、模型效果监控与回归评测
能够将模糊、开放的模型行为问题拆解成具体、可执行、可复现的评测实验,并根据数据得出结论
具备分布式系统、API、数据处理流水线或后端平台的设计与开发经验
熟悉模型评测的基本方法,能够独立设计测试集、评分标准、评测指标和回归验证方案
重视评测结果的可靠性和可解释性,能够识别数据污染、评分偏差、统计噪声和评测集饱和等问题
既关注 Benchmark 指标,也关注模型在真实场景中的实用性、可靠性、诚实性和交互体验
具备较强的自主性,能够在目标或实现路径尚不明确的情况下推进项目落地
具备良好的分析、沟通和文档表达能力,能够清晰说明评测方法、实验结果和优化建议
工作职责
设计智能体评测任务,覆盖工具调用、计算机操作、多智能体协作、长周期任务执行、事实准确性、指令遵循和复杂推理等方向
将抽象的模型行为问题转化为可验证的评测实验,完成假设定义、数据构建、模型运行、结果分析和迭代决策
研究模型行为的自动化探索方法,持续发现模型在复杂任务、长尾场景和真实业务流程中的能力边界与失败模式
建设可靠、可复现、可扩展的评测流水线,支持不同模型、模型版本、Prompt、智能体框架和工具配置的批量实验
建设持续评测与模型健康监控体系,包括:标准测试集和 Golden Dataset 建设、回归与性能漂移监控、模型版本对比、评测结果可视化、失败案例分析、自动化反馈和改进闭环
分析评测方法的可靠性、可扩展性、方差、统计显著性和评分一致性,持续提升评测结果的可信度
设计并维护评测相关的后端服务、数据管道和 API,将内部数据转换为适合模型、智能体和下游 AI 工作流使用的结构化格式
将评测结果反馈到数据集、Prompt、评分器、智能体架构和产品方案中,推动模型与产品效果持续优化
负责评测系统从原型设计、工程实现、上线运行到长期维护的完整生命周期,在快速实验的同时保证系统稳定性、扩展性和可维护性
优先资格
● 独立构建过大模型 Benchmark、评测集或自动评分系统
● 开发过智能体任务环境、评测 Harness 或沙箱执行系统
● 具备大规模评测平台、实验平台或模型监控系统建设经验
● 熟悉 Prompt、Sampling 和 Agent Scaffolding 对评测结果的影响
● 熟悉统计实验设计、方差分析、置信区间和显著性检验
● 有可观测性、回归检测或实验追踪系统经验
● 有大规模数据集构建、清洗、标注和质量控制经验
● 对工具调用、计算机操作、多智能体或长周期智能体有深入实践
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台大,资源多,业务场景丰富
- 接触前沿AI技术,尤其是智能体和LLM评测领域
- 岗位核心度高,参与AI产品关键环节
- 薪资福利有竞争力
- 技术要求高,需要掌握多领域知识
- 快速迭代可能导致工作节奏较快
缺点 / 挑战
- 评测任务复杂,需处理模糊问题,有一定压力
- 适合对AI有浓厚兴趣、喜欢技术挑战和实证分析的工程师
角色解读
- 向AI评测专家或技术负责人发展
- 深入智能体技术,成为AI应用架构师
- 横向扩展到模型研发或产品方向
- 设计智能体评测任务,覆盖工具调用、多智能体协作等场景
- 将模型行为问题转化为可验证的实验,并进行数据分析和迭代
- 建设评测流水线和监控体系,确保模型效果可追踪和优化
- 分析评测方法可靠性,提升评测结果的可信度
- 扎实的编程能力(Python/Go)和系统设计能力
- 熟悉大模型和智能体技术,了解LLM评测方法
- 掌握数据管道、分布式系统等工程化技能
- 具备统计和实验设计基础,能分析实验数据
申请策略
- 了解蚂蚁的AI产品线,特别是“AI创新产品”的方向
- 准备一个完整的评测方案案例,展示系统设计思维
- 突出大模型或智能体相关项目经验,特别是评测方向
- 展示工程能力,如搭建过数据管道或后端系统
- 量化成果,如提升模型评测效率或准确性
- 若有开源贡献或Benchmark参与经历,重点提及
- 补充LLM评测方法论,如LLM-as-a-Judge
- 熟悉智能体框架(如LangChain, AutoGPT)和工具调用
面试指南
- 针对这类开放性问题,建议采用“目标-方法-结果”的框架,具体描述当时的背景、你如何拆解问题、采取的措施以及最终效果
- 强调数据驱动和工程实现能力
- 如何设计一个智能体评测任务?请举例说明
- 你的评测系统如何处理数据污染问题?
- 如何确保评测结果的可复现性?
- 当你发现评测指标异常时,如何排查问题?
- 描述一次你通过数据驱动优化模型或产品的经历
- 熟悉大模型评测的常见方法与指标(如准确率、F1、一致性)
职位点评
80
综合评分
大厂AI核心岗,技术前沿,薪资优厚,但需现场办公且节奏可能较快。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和前沿方向的求职者,对WLB要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活60
使命价值80
薪资福利
85较高
薪资市场领先,蚂蚁集团平台大,福利有竞争力。
薪资信号未披露(AI估算:35K-55K/月)
成长发展
90较高
岗位涉及大模型和智能体前沿技术,技能成长快,发展空间大。
技术前沿前沿/新兴技术
技术栈大语言模型、智能体、Benchmark、LLM-as-a-Judge、数据管道
业务类型profit_center
工作生活
60中等
现场办公,未明确提及弹性工作,但工作地点在一线城市。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
AI领域高速发展,智能体技术有广阔应用前景,对社会有积极影响。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs