
蚂蚁集团
蚂蚁集团-Agent 评测研发工程师-健康事业群
蚂蚁集团-Agent 评测研发工程师-健康事业群
发布于 大约 14 小时前普通员工/个人贡献者
上海市 / 杭州市
中级经验
全职员工
仅现场办公
本科
机器学习工程
Gaia
Llm
Rag
Rlhf
Sft
模型评测
自动化测试
Swe Bench
AI 估算 · 25k–50k
大厂AI核心岗位,技能要求高,薪资竞争力强,通常16薪。
职位详情
关于这个职位
该职位负责蚂蚁集团健康事业群大模型Agent系统的全流程评测,包括评测方案设计、数据集构建、指标定义、运行轨迹分析与问题归因,并开发自动化评测框架提升效率
需要扎实的Python能力和对LLM后训练范式的深入理解,同时关注Agent前沿评测技术,适合对AI评测方向有热情、具备算法与工程双重能力的候选人
最低要求
计算机/数学/统计/AI 相关专业本科及以上,硕士/博士优先
扎实的算法与工程能力:熟练 Python,能独立完成评测框架开发、数据处理与分析
深刻理解 LLM/Transformer 及后训练范式:SFT、RLHF/DPO/Reward Modeling 等
理解 Agent/RAG 的典型失败模式与评测要点
有大模型评测/后训练经验:大模型评测、后训练、A/B 实验、统计推断等方向有实战沉淀
工作职责
负责大模型 Agent 系统的全流程评测工作,涵盖功能评测、性能评测、效果评测及稳定性评测,重点关注评测过程的稳定性保障与评测效率提升,搭建完善的评测体系与标准,确保 Agent 输出质量符合业务预期
设计并执行大模型 Agent 的评测方案,包括评测数据集构建、评测指标定义、评测流程规划,重点针对长程任务场景开展专项评测,熟悉 SWE Bench、Terminal Bench、GAIA 等主流 Agent 评测 benchmark,能基于 benchmark 完成评测落地、结果分析与优化,同时覆盖 Agent 的任务完成率、响应准确性、逻辑连贯性、工具调用合理性等核心维度评测
进行 Agent 运行轨迹分析与问题归因,梳理 Agent 在任务执行过程中的决策链路、工具调用流程、上下文交互等关键环节,定位输出异常、性能瓶颈、逻辑漏洞等问题,形成详细的归因报告并推动优化
结合算法能力,对大模型 Agent 的核心算法模块(如意图识别、决策规划、工具调用、知识检索等)进行评测与分析,评估算法效果,提出针对性的优化建议,协同算法团队迭代提升
负责评测工具的开发与维护,基于工程能力搭建自动化评测框架,优化评测流程与工具性能,保障评测过程的稳定性,提升评测用例执行效率、结果统计与分析效率,支撑 Agent 版本的快速迭代验证
跟踪大模型及 Agent 评测领域的前沿技术,引入先进的评测方法、工具与指标,持续优化评测体系,提升评测工作的专业性与前瞻性
协同产品、算法、开发团队,同步评测结果与问题归因,推动问题整改与功能优化,保障 Agent 系统的稳定性、可靠性与业务适配性
优先资格
熟悉或有经验构建/使用主流评测集与框架者优先:C-Eval、CMMLU、HumanEval、AGIEval,或 HELM、lm-evaluation-harness 等
有医疗/合规/安全相关经验加分
有大厂大模型算法/评测/平台化经验加分
发表过顶会论文(ICLR/NeurIPS/ACL等)优先
AI 洞察
优缺点分析
优点
- 站在大模型技术前沿,接触最热门的Agent方向
- 蚂蚁集团平台大,资源多,成长空间大
- 评测工作对系统性思维要求高,能积累独特技能
- 大模型评测领域尚不成熟,需要自己探索方法
- 工作可能涉及大量数据处理和实验,需要耐心
- 适合对大模型技术有热情、喜欢系统性思考、具备扎实工程能力的候选人
缺点 / 挑战
- 大厂工作节奏快,可能有加班压力
角色解读
- 可以从评测工程师向大模型算法专家发展,深入算法优化
- 可以在评测领域成为专业方向负责人,搭建团队
- 可以转向核心算法研发,如Agent规划、工具调用等
- 负责大模型Agent系统的全流程评测,包括功能、性能、效果和稳定性评测,确保输出质量符合业务预期
- 设计评测方案,构建评测数据集,定义指标,并针对长程任务开展专项评测,如SWE Bench、GAIA等
- 分析Agent运行轨迹,定位异常和性能瓶颈,形成归因报告并推动优化
- 开发自动化评测框架,提升评测效率,并跟踪前沿评测技术
- 熟练Python,能独立开发评测框架和数据处理
- 深入理解LLM/Transformer及后训练范式(SFT、RLHF等)
- 掌握Agent/RAG的典型失败模式和评测要点
- 具备大模型评测、后训练、A/B实验、统计推断等实战经验
申请策略
- 关注蚂蚁健康事业群的具体业务,准备相关理解
- 申请时表达对评测领域的热爱和长期投入意愿
- 突出大模型相关项目经验,特别是评测或训练方面的实践
- 展示Python编程能力和数据处理经验
- 如果有使用过主流评测集或框架(如C-Eval、HELM等)一定要写
- 如果有顶会论文或开源贡献,重点标注
- 熟悉主流Agent评测基准,如SWE Bench、GAIA,尝试跑通流程
- 深入学习RLHF/DPO等技术细节
面试指南
- 使用STAR法则回答项目经验,突出你的设计思路和量化结果
- 对于评测设计问题,从目标、指标、数据集、流程、结果分析几个维度展开
- 结合具体例子,展示对Agent失败模式的理解
- 请介绍你做过的一个大模型评测项目,如何设计指标和数据集?
- 如何评测一个Agent的任务完成率和工具调用合理性?
- 谈谈你对RLHF的理解,以及它在Agent训练中的作用
- 给定一个长程任务场景,你会如何设计评测方案?
- 如何提升评测效率和稳定性?
职位点评
72
综合评分
大厂AI评测前沿岗,技术成长快,薪资好,WLB存疑。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、对AI前沿充满热情、不刻意追求WLB的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值70
薪资福利
75中等
大厂薪酬体系完善,该岗位属于高价值AI方向,薪资竞争力强,但JD未披露具体福利。
薪资信号未披露(AI估算:25K-50K/月)
成长发展
85较高
岗位涉及大模型Agent评测前沿技术,能深度积累算法与工程能力,成长空间大。
技术前沿前沿/新兴技术
技术栈Python、LLM、Agent、RAG、SFT、RLHF、模型评测、自动化测试
业务类型ambiguous
工作生活
50较低
工作地点为上海/杭州,JD未提及弹性办公或加班情况,WLB不确定。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
大模型Agent是高速增长赛道,但岗位以技术实现为主,社会直接价值有限。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs