
蚂蚁集团
蚂蚁集团-评测算法工程师-成都
蚂蚁集团-评测算法工程师-成都
发布于 大约 8 小时前普通员工/个人贡献者
成都市
中级经验
全职员工
仅现场办公
学历未注明
研究与开发 (研发)
Ab实验
Agentic Workflows
Llm
Llm-As-A-Judge
Nlp
大模型评测
推荐系统
搜索
AI 估算 · 25k–45k
AI评测赛道热门,大厂成都中级岗位,薪资竞争力强,综合月薪中位数约35k。
职位详情
关于这个职位
作为蚂蚁集团的评测算法工程师,你负责AI/算法类产品的质量保障,设计评测策略并构建高难度评测集,使用LLM-as-a-Judge等前沿技术进行效果评估
你将与AI Research团队紧密协作,通过Bad Case归因指导模型优化,并推动评测技术发展规划,适合对AI评测有热情的技术专家
最低要求
年以上互联网或传统行业算法/开发/测试经验,具备 1 年以上 AI/算法类产品评测经验(大模型 / 推荐 / 搜索 / NLP)
熟悉算法服务测试场景(精度验证、AB 实验评估等),熟悉常用评测指标(准确率 / 召回率 / F1-score 等),掌握 Bad Case 归因与评测数据集构建方法
熟悉主流算法框架,熟练使用 Python/Java 等编程语言
对新质技术敏锐度高,能快速理解 AI 产品特性,具备技术攻关与团队协作能力
工作职责
按照产品架构和业务要求,设计覆盖功能与非功能需求的评测策略,负责 AI/算法类产品的效果符合设计预期,保障系统稳定性
面向复杂推理、Agentic Workflows 等前沿能力构建高难度评测集
开发支持万级并发、对接训练集群的评测流水线,实现 Checkpoint 边训边评与分钟级反馈
规模化落地LLM-as-a-Judge,解决开放式生成量化难题
对 Bad Case 做算法级归因,将洞察反馈 AI Research 团队,指导数据配比与合成数据生成
研究评测相关新技术方法,攻克评测复杂技术/算法问题
能结合AI行业发展趋势,制定合适的评测技术发展规划,提升团队技术视野和技术影响力
优先资格
有基座模型评测工程经验者优先
有评测流水线 / 工具平台开发经验优先
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台大,资源丰富,可接触前沿AI大模型技术
- 工作内容包括LLM-as-a-Judge、Agentic Workflows等前沿方向,技术成长快
- 成都生活成本相对较低,团队氛围好,有较好的工作生活平衡潜质
- 薪资福利具有竞争力,且有机会获得期权
- 对新技术敏感度要求高,需要持续学习快速迭代
- 评测工作可能面临复杂问题,需要较强的逻辑分析和归因能力
- 适合热爱AI技术、有算法背景、善于解决复杂问题并追求技术深度的求职者
缺点 / 挑战
- 大模型评测领域标准尚未统一,工作具有一定的模糊性和挑战性
角色解读
- 内部晋升为评测技术专家或架构师,主导AI质量体系建设
- 横向转型至AI研发或数据科学岗位,拓展算法模型优化能力
- 在AI领域持续深耕,参与行业标准制定,成为业界KOL
- 设计AI产品的评测策略,覆盖功能与非功能测试,确保产品质量
- 构建高难度评测集,开发万级并发评测流水线,实现分钟级反馈
- 应用LLM-as-a-Judge解决开放式生成量化难题,对Bad Case进行算法归因
- 跟踪AI行业趋势,制定评测技术发展规划,提升团队技术影响力
- 扎实的算法基础,熟悉常用评测指标(准确率、召回率、F1等),掌握AB实验评估方法
- 精通Python/Java,熟悉主流算法框架(如PyTorch、TensorFlow等),具备工程化能力
- 深入理解大模型、推荐、搜索、NLP等AI产品特性,能快速定位问题
- 具备技术攻关和团队协作能力,能推动评测体系优化
申请策略
- 关注蚂蚁集团在AI领域的研发布局,在面试中展现对评测技术的理解
- 准备个人项目或开源贡献,展示解决实际评测问题的能力
- 突出AI/算法评测经验,特别是大模型、推荐、搜索相关项目的成果
- 展示自动化评测流水线或工具平台开发经验,体现工程能力
- 强调Bad Case分析、评测数据集构建等具体案例,量化效果
- 体现技术前瞻性,如参与过前沿模型评测、在业界有影响力
- 补充LLM-as-a-Judge、Agentic Workflows等评测方法的知识
- 提升大规模分布式系统评测的工程能力,如万级并发流水线设计
面试指南
- 对于设计类问题:明确评测目标(功能/非功能),选择合适指标,考虑数据多样性和场景覆盖,提出自动化方案
- 对归因问题:描述问题现象→分析可能原因(数据、模型、特征等)→通过对比实验验证→总结根因并提出改进建议
- 对技术选型问题:对比不同方法的优劣,结合实际场景给出权衡,展示技术深度
- 如何设计一个大模型产品的评测方案?
- 请介绍一个你解决过的Bad Case归因案例
- 你对LLM-as-a-Judge的看法?有哪些优缺点?
- 如何构建高难度的评测集?
- 在万级并发场景下,如何保证评测流水线的稳定性和效率?
职位点评
68
综合评分
大厂AI评测技术岗,前沿技术栈,成长性强,WLB未明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合理性强、追求技术前沿、愿意接受一定工作强度的求职者,看重成长而非生活平衡。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展85
工作生活50
使命价值80
薪资福利
60中等
薪资虽未明确但大厂中级岗位通常有竞争力,福利未提及,但蚂蚁集团整体福利较好,综合评分中等。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
85较高
高度技术前沿,涉及大模型、Agentic Workflows等新兴方向,成长空间大,但未明确晋升通道。
技术前沿前沿/新兴技术
技术栈LLM、Agentic Workflows、LLM-as-a-Judge、大模型评测、NLP、推荐系统、搜索
成长机会技术发展规划、技术视野
业务类型ambiguous
工作生活
50较低
仅现场办公,未提及弹性或远程,成都工作环境尚可,但未明确WLB信号。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
AI行业高速增长,技术创新性强,对模型效果有直接影响,社会意义中等。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs