Ant Group logo
蚂蚁集团
网商银行-算法评测-杭州

网商银行-算法评测-杭州

发布于 大约 2 小时前

普通员工/个人贡献者

杭州市
高级经验
全职员工
仅现场办公
本科
测试开发
Ab实验
大模型
性能压测
测试工具开发
算法评测
自动化测试
评测指标

AI 估算 · 20k–40k

杭州互联网大厂算法评测岗位,技术门槛高,负责AI产品测试,薪资竞争力强。

职位详情

关于这个职位

该职位负责网商银行AI/算法类产品的质量保障工作,包括智能引擎和大模型应用的评测体系设计、性能压测和工具开发

需要具备算法评测基础,精通Python/Java,并熟悉自动化、性能或安全测试
适合有三年以上测试经验、对AI技术有热情的工程师

最低要求

计算机、信息、人工智能、数据等相关专业本科及以上学历

三年以上互联网及传统行业开发测试和质量保障经验,具备一年以上AI/算法类产品的算法评测等测试经验(如大模型/推荐/搜索/NLP系统)
熟悉算法服务测试场景(如精度验证、AB实验评估等),精通至少一个测试领域(自动化/性能/安全)
熟悉主流算法框架,熟练使用Python、java等至少一种编程语言,有测试工具平台开发经验
具备算法评测基础知识,熟悉常用评测指标(准确率/召回率/F1-score等),了解badcase分析及评测数据集构建等评测方法
对新质量技术敏锐度高,能快速理解AI产品特性,具备技术攻关和团队协作能力

工作职责

按照产品架构和业务要求,设计覆盖功能及非功能需求的质量保障策略,主要负责AI/算法类产品质量(如智能引擎、大模型应用)

参与AI业务系统架构设计方案评审,进行专项评测方案设计,包括评测指标体系、评测集、性能压测等
解决测试复杂技术问题,开发适配算法服务的测试工具(评测数据集构造、模型效果评估等),提升效能与品质
研究测试新技术方法,重点推进AI算法评测、AI原生应用测试能力升级等创新方向,攻克算法领域特有质量难题

优先资格

有算法评测工程经验者优先

AI 洞察

优缺点分析

优点

  • AI评测是新兴热门领域,技术前沿,个人价值提升快
  • 工作涉及大模型等前沿技术,有较多创新空间
  • 团队氛围通常是技术驱动,适合钻研型人才
  • 性能压测和大型系统测试可能带来高强度工作节奏
  • AI技术迭代快,需要持续跟进新技术,否则容易落后
  • 适合对AI技术有强烈兴趣、具备扎实测试背景、喜欢攻克复杂问题并追求技术成长的工程师

缺点 / 挑战

  • 蚂蚁集团平台大,金融场景丰富,能接触真实业务和规模化挑战
  • 算法评测复杂度高,需要同时理解算法和测试,学习压力较大

角色解读

  • 从测试开发向AI评测专家发展,专精大模型和推荐搜索等领域的质量保障
  • 有望成为测试架构师或质量团队负责人,主导AI产品评测体系搭建和团队能力建设
  • 可横向拓展至AI产品研发、数据分析或算法工程等岗位,因技术功底扎实
  • 负责AI/算法类产品的质量保障策略设计,覆盖智能引擎、大模型应用等,确保功能和非功能需求达标
  • 设计和执行专项评测方案,包括评测指标体系、评测集构建、性能压测,参与系统架构评审,从测试角度提出改进建议
  • 开发适配算法服务的测试工具,如评测数据集构造、模型效果评估,解决测试中的复杂技术问题并提升效率
  • 研究AI算法评测新技术,推动AI原生应用测试能力升级,攻克算法领域特有的质量难题
  • 扎实的测试功底,精通自动化、性能或安全至少一个领域,熟悉算法服务测试场景如精度验证、AB实验
  • 编程能力突出,熟练使用Python或Java,具备测试工具平台开发经验
  • 熟悉主流算法框架,掌握准确率、召回率、F1-score等评测指标,了解badcase分析和评测数据集构建
  • 快速学习AI产品特性,具备技术攻关和团队协作能力

申请策略

  • 了解蚂蚁集团和网商银行的业务与技术栈,在面试中展示对金融AI场景的理解
  • 准备一个完整的算法评测项目案例,说明从方案设计到落地执行的流程
  • 突出AI/算法类产品的评测或测试经验,如大模型、推荐系统等,展示具体项目和成果
  • 强调测试工具开发能力,如自研的评测数据集构造工具或效果评估平台
  • 展示在自动化、性能或安全测试领域的深度专长,并量化成果(如效率提升、缺陷发现数)
  • 体现对算法评测指标(准确率、召回率、F1-score)的理解及实际应用案例
  • 学习大模型评测方法,了解helm、lm-eval等开源评测框架
  • 提升Python编程能力,熟悉pytest、JMeter等测试工具,并掌握基础机器学习知识

面试指南

  • 结构化回答:明确目标→设计指标→构建数据集→选择评估方法→分析结果→迭代优化
  • 结合案例,突出量化结果和遇到的问题及解决方案,展现逻辑性和工程能力
  • 强调对AI模型原理的理解,但避免过度深入算法细节,重点在测试视角
  • 如何设计一个大模型应用的评测方案?请从指标、数据集、评估方法等方面阐述
  • 解释准确率、召回率、F1-score、AUC等常用指标的区别和适用场景
  • 针对一个推荐系统,如何构建评测集并分析badcase?
  • 如何实现一个高效的性能压测?你使用过哪些工具?
  • 你如何看待AI原生应用测试与传统功能测试的差异?

职位点评

69
综合评分

大厂AI评测前沿岗位,技术成长快,薪资中上,但WLB不明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最合适追求技术成长、热爱AI前沿领域、能接受现场办公和一定工作压力的人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值60

薪资福利

70中等

职位于杭州蚂蚁集团,薪资竞争力强,但具体薪酬面议,福利未披露,综合而言补偿性中等偏上。

薪资信号未披露(AI估算:20K-40K/月)

成长发展

85较高

技术前沿,主攻AI算法评测和大模型应用测试,有明确的创新方向,成长空间大。

技术前沿前沿/新兴技术
技术栈AI、大模型、算法评测、Python、Java、性能压测、自动化测试、评测指标
业务类型cost_center

工作生活

50较低

仅现场办公,地点在杭州,未提及弹性工作或加班情况,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

AI行业高速增长,但职位偏向内部质量保障,社会影响力中性,意义感一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs