
蚂蚁集团
网商银行-AI评测产品经理-杭州
网商银行-AI评测产品经理-杭州
发布于 大约 2 小时前普通员工/个人贡献者
杭州市
初级经验
全职员工
仅现场办公
学历未注明
AI产品经理
Ai Agent
Llm
产品设计
数据集
标注
评测体系
金融科技
AI 估算 · 15k–25k
初级产品经理,蚂蚁集团平台,杭州互联网行业薪资较高,福利完善,月薪1.5-2.5万合理,通常发放15薪。
职位详情
关于这个职位
作为AI评测产品经理,你将深度参与蚂蚁集团网商银行的智能客户经理“百灵”的评估与优化
核心工作包括设计大模型评测体系、执行Agent能力评测,并结合业务场景提出改进建议
该岗位能够让你站在AI技术前沿,与算法、产品、业务团队紧密协作,直接影响金融场景下大模型的应用效果
适合对AI产品评测有热情、具备1-2年产品经验并熟悉LLM的候选人
最低要求
理工科背景,计算机或算法专业优先
具备1-2年产品相关经验,包括AI、评测
对LLM、AI Agent以及评测方法论有较好的理解
熟悉Benchmark、数据集以及标注相关流程
学习能力强,好奇心强,具备优秀的跨团队协作与沟通能力
工作职责
理解、研究用户和业务:深度理解小微企业的金融需求、经营痛点及风险特征,结合AI技术发展趋势,设计并优化AI智能客户经理-百灵
Agent评测:负责AI智能客户经理的评估体系设计、评估结论产出,提出有针对Agent各个环节的改进建议,提升大模型能力与应用效果
搭建评测体系:设计大模型能力及应用效果的评估体系,搭建评测流程和功能
调研大模型行业最新评测研究和报告,结合实际应用场景,更新内部评测技术方案
AI 洞察
优缺点分析
优点
- 身处AI大模型前沿领域,能够接触最新的LLM和Agent技术,快速积累稀缺的评测经验
- 蚂蚁集团平台大,业务场景丰富,个人影响力可辐射金融科技核心业务
- 岗位涉及产品、算法、业务多方协同,锻炼综合能力,职业发展空间广阔
- 团队注重学习与创新,能持续跟踪行业最新评测研究,保持技术领先
- AI评测领域方兴未艾,方法论和工具尚不成熟,需要不断探索和试错
- 跨团队沟通协作要求高,需要平衡不同角色诉求,推进效率可能受多方制约
- 作为支持型岗位,成果通过他人落地,可能不如业务产品直接看到业绩反馈
- 适合对AI技术有浓厚兴趣、乐于钻研评测方法、具备强沟通能力并且能适应快速变化的产品经理
缺点 / 挑战
暂无明显挑战项
角色解读
- 在AI评测领域深耕,可成长为AI评测专家,主导大模型评测标准和行业规范
- 结合业务理解,可向AI产品经理、大模型产品负责人等方向晋升,负责更完整的产品线
- 通过接触前沿技术与业务场景,积累深厚行业经验,未来可转向战略或管理岗位
- 设计并持续优化AI智能客户经理“百灵”的产品体验,基于小微企业金融场景挖掘需求并转化为产品方案
- 主导Agent评测体系的设计与执行,产出评测结论,为算法和产品团队提供改进方向,推动大模型能力落地
- 搭建和完善评测流程与工具,跟进大模型行业最新评测研究,持续迭代内部评测技术方案
- 与算法、工程、业务等多方协作,确保评测结果能有效驱动业务决策和模型优化
- 具备LLM和AI Agent的基础知识,理解评测方法论,熟悉Benchmark、数据集和标注流程
- 有1-2年产品经验,能独立负责评测项目从设计到落地的完整流程
- 具备优秀的逻辑分析和数据敏感度,能通过评测数据发现问题并提出改进建议
- 善于跨团队沟通和协作,能够平衡多方需求,推动项目进展
申请策略
- 关注蚂蚁集团招聘官网和内部推荐渠道,了解团队文化,针对岗位要求定制简历
- 在面试中多展示你对AI评测的思考和热情,可以准备一个你设计过的评测方案案例
- 突出你在AI产品、评测或大模型相关项目中的具体贡献,如设计过评测体系、搭建过数据集
- 强调产品经验与数据能力,说明如何通过评测数据推动模型优化,附上量化结果
- 展示对LLM/AI Agent的深入理解,可提及你关注的行业评测标准或论文
- 体现跨团队协作案例,说明在复杂项目中如何协调资源并达成目标
- 深入学习LLM和Agent的最新进展,熟悉评测框架如GLUE、SuperGLUE、HumanEval等,补充评测实践
- 学习数据标注与管理方法,了解不同任务类型的数据集构建质量对评测的影响
面试指南
- 从业务目标出发,先明确评测的维度和目标,再设计指标、数据构建流程和评估方法,强调严谨性和可迭代性
- 对于Agent评测,突出多轮交互、工具调用等场景,结合离线与在线评测,并以实例说明
- 面对效果不理想,先通过细分数据挖掘失败模式,再与算法团队讨论原因,提出可执行的改进方向
- 如何为大语言模型设计一套针对特定业务场景的评测体系?
- 你如何理解AI Agent的能力评估?与传统模型评测有什么不同?
- 如果评测结果显示模型效果不理想,你会如何定位问题并提出改进建议?
- 如何保证评测数据集的质量和代表性?
- 跨团队协作中,遇到算法团队与业务团队意见不一致时,你会怎么处理?
职位点评
71
综合评分
头部平台+前沿AI评测方向,成长性极好,但工作强度和办公灵活性未明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长、渴望参与AI前沿领域并具备较强学习能力的求职者,对工作生活平衡要求极高的候选人需谨慎。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值75
薪资福利
70中等
职位JD未披露薪资及具体福利,但蚂蚁集团作为头部互联网公司,整体薪酬福利具有较强竞争力,能满足基本补偿性需求。
薪资信号未披露(AI估算:15K-25K/月)
成长发展
85较高
岗位聚焦LLM和AI Agent评测,属于前沿技术方向,能接触最新行业研究并深度参与大模型产品落地,成长空间大。
技术前沿前沿/新兴技术
技术栈LLM、AI Agent、Benchmark、数据集
业务类型ambiguous
工作生活
50较低
JD中未提及远程或弹性工作信息,工作地点杭州,具体办公区域和加班情况未明确,生活化满足程度一般。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
岗位服务小微企业金融需求,直接助力普惠金融,具有一定的社会价值,同时AI大模型行业高速增长,使命感较强。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs