
蚂蚁集团
蚂蚁集团-算法评测专家-AIRS
蚂蚁集团-算法评测专家-AIRS
发布于 大约 1 小时前普通员工/个人贡献者
北京市 / 杭州市
高级经验
全职员工
仅现场办公
本科
机器学习工程
Ai评测
Llm
Prompt Engineering
多模态
搜推系统
数据分析
自动化工具链
AI 估算 · 40k–70k
资深AI评测人才稀缺,大模型赛道热,岗位技术含量高,薪资竞争力强。
职位详情
关于这个职位
该职位负责构建大模型评测基准体系,涵盖搜索推荐、多模态及Agent场景,设计评测方案并持续迭代自动化流水线
作为蚂蚁集团AIRS团队的算法评测专家,您将追踪前沿模型、开展竞品对标,为产品优化和算法策略调优提供高价值决策支持
适合热爱AI技术、擅长跨团队协同的算法评测人才
最低要求
学历专业:计算机或人工智能相关专业本科及以上学历,有顶会模型评估或对齐相关论文发表,或拥有相关领域核心专利者优先
评测经验:3年以上AI算法评测经验,深入理解大模型边界,具备搜推、多模态或复杂Agent深度评测实战经验者优先
工程能力:精通主流评测框架,熟练掌握Python,能独立主导大型评测平台与自动化工具链的设计开发
具备丰富的Prompt Engineering调优经验
数据洞察:逻辑思维强,能从复杂数据中定位关键问题,输出高价值诊断报告并推动策略落地
综合素质:对AI技术极度敏感且富有热情,具备出色的跨团队统筹协调能力与构建科学评测体系的工匠精神
工作职责
Benchmark体系建设:主导构建覆盖搜推、多模态及Agent的全链路评测基准,保障评测体系的科学性与行业领先性
评测方案与指标设计:针对多维业务场景设计科学的评估体系,并根据技术与业务演进持续迭代自动化评测流水线
竞品对标与决策支持:常态化追踪前沿模型进展开展横向对标,为产品优化和算法策略调优提供高价值的判断与建议
技术研究与创新破局:跟踪业界最新评测方法,积极探索并引入自动化评估,以技术创新驱动评测能力的持续进化与业务价值落地
跨团队协同与合作:联动产品、算法及工程团队,将客观的评测结论转化为具体可落地的业务优化方向与策略调整建议
优先资格
有顶会模型评估或对齐相关论文发表,或拥有相关领域核心专利者优先
具备搜推、多模态或复杂Agent深度评测实战经验者优先
AI 洞察
优缺点分析
优点
- 身处蚂蚁集团AIRS,接触大模型最前沿的评测难题,技术含金量高
- 工作涵盖搜推、多模态、Agent等多元场景,技能可迁移性强
- 有机会影响产品与算法决策,个人价值能见度高
- 薪资与福利在大厂中处于第一梯队,职业发展空间大
- AI评测领域方法论尚不成熟,需要较强的研究能力和创新破局意识
- 跨团队协同频繁,沟通成本和项目推进难度不小
- 岗位对综合能力要求高,既要懂算法还要有工程和数据洞察能力
- 适合对AI评测有热情、乐于钻研大模型边界、既能做深度技术分析又能跨团队推动落地的人
缺点 / 挑战
暂无明显挑战项
角色解读
- 专业路线:从评测专家成长为评测体系架构师,主导行业评测标准制定
- 横向发展:可转向算法研究、模型对齐或AI平台工程等相邻领域
- 管理路线:带团队构建专家评测团队,向技术负责人或AI实验室管理岗发展
- 主导构建覆盖搜推、多模态及Agent的全链路评测基准,确保评测体系科学且领先
- 设计评测方案与指标,并根据业务演进持续迭代自动化评测流水线
- 追踪前沿模型进展做横向对标,为产品优化和算法策略调优提供数据判断
- 联动产品、算法和工程团队,将评测结论转化为落地的优化方向
- 深厚的AI算法评测经验,理解大模型边界与评测方法论
- 精通主流评测框架与Python,能独立开发评测平台和自动化工具链
- 丰富的Prompt Engineering调优经验,熟悉数据洞察与诊断报告撰写
- 较强的跨团队协同能力和对AI技术的高度热情
申请策略
- 提前了解蚂蚁AI基础设施与AIRS团队定位,思考自己能解决什么核心问题
- 在简历中展现对评测科学体系的深入理解,而不只是罗列工具
- 突出搜索推荐、多模态或Agent领域的评测项目经验,最好有具体量化成果
- 展示主导或深度参与评测平台、自动化工具链建设的技术方案
- 强调Prompt Engineering调优或顶会论文/专利等硬核加分项
- 用案例说明如何通过评测数据推动产品/算法策略优化
- 系统梳理大模型评估主流方法,如Benchmark构建、自动化评估、红队测试等
- 动手实践常用评测框架,积累Python工程能力,尝试搭建小型评测流水线
面试指南
- 用『问题→设计→执行→验证』的框架,强调科学性与业务闭环
- 先阐述评测目标与边界,再讲方法选择和量化指标,最后用案例佐证
- 遇到矛盾时,突出数据证据与跨团队协作,用MVP快速验证迭代
- 谈谈你设计评测基准的整体思路,遇到过哪些挑战如何解决?
- 在复杂Agent或多模态评测中,你怎么定义『好』并保证评估可靠性?
- 如何用自动化评测流水线替代部分人工评估,存在哪些风险?
- 当你评测结果与业务预期不一致时,如何处理?
- 如何向非技术团队解释评测指标并推动优化落地?
职位点评
71
综合评分
蚂蚁AI实验室核心算法评测专家岗,前沿技术栈,薪资优厚但WLB未明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求AI前沿技术成长、不介意现场办公和一定工作压力、看重专业影响力的人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值65
薪资福利
75中等
作为大厂资深AI专家,薪资和福利预计有竞争力,但JD未具体披露。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
85较高
岗位聚焦大模型评测这一前沿领域,技术迭代快,个人专业能力成长空间大。
技术前沿前沿/新兴技术
技术栈大模型、AI评测、Python、Prompt Engineering、Agent、多模态、搜推、自动化评测
业务类型ambiguous
工作生活
50较低
要求现场办公,JD未提弹性工作,但大厂机制较规范;具体加班情况不明确。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
65中等
工作有利于推动大模型安全可靠落地,社会意义较强,但更多是技术价值。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs