DiDi logo
滴滴出行
资深测试开发工程师(Agent测评工程师)

资深测试开发工程师(Agent测评工程师)

发布于 大约 2 小时前

普通员工/个人贡献者

成都市
高级经验
全职员工
仅现场办公
本科
测试开发
Agent测评
Ai测试
Llm
多轮交互
大模型
测试开发
自动化测试
评测平台
质量保障

AI 估算 · 20k–35k

资深测试开发,AI测评方向人才稀缺,成都薪资合理,大厂福利补充,综合月薪2-3.5万。

职位详情

关于这个职位

作为滴滴出行企业级事业部的资深测试开发工程师,你将专注于AI Agent与智能助手的测评工作,设计评测方案与指标,覆盖对话理解、任务规划、工具调用等核心能力

你需要与产品、算法、研发团队紧密协作,推动评测标准建设和质量闭环,并参与自动化评测平台建设,提升测试效率
这是一个深入AI前沿领域、技术挑战大、成长空间广的岗位,适合对质量保障和人工智能交叉领域有浓厚兴趣的工程师

最低要求

具备 3 年及以上测试、AI 测评或质量保障相关经验

熟悉测试流程,具备良好的需求分析、测试设计、问题定位和报告输出能力
了解 LLM / Agent 常见能力与风险,如意图理解、逻辑推理、指令遵循、工具调用、幻觉、安全合规等
掌握 Python / Java / Go / Shell 等至少一种编程或脚本语言
具备良好的逻辑分析、沟通协作和学习能力,能独立推动问题闭环

工作职责

负责企业级 AI Agent / 智能助手的测评工作,包括需求分析、场景拆解、测试设计、用例编写与执行,保障产品质量

针对 Agent 业务场景,设计评测指标和评测方案,覆盖对话理解、任务规划、工具调用、多轮交互、结果准确性、异常处理等能力
跟进 Agent 版本迭代,进行效果评估、基线对比、问题归因和风险识别,输出测评报告及优化建议
参与自动化评测脚本、评测集和评测平台建设,提升测评效率和覆盖率
与产品、算法、研发团队协作,推动评测标准建设和质量问题闭环

优先资格

本科及以上学历优先,计算机、人工智能、软件工程、数学等相关专业优先

有大模型、Agent、智能助手测评经验优先
有自动化测试或评测平台建设经验优先

AI 洞察

优缺点分析

优点

  • AI赛道热门,Agent测评是新兴方向,技术含金量高,积累稀缺经验
  • 大厂平台,流程规范,有丰富的业务场景和技术资源
  • 工作涉及多团队协作,能提升综合能力,有较好的职业发展空间
  • 对技术深度要求高,需要既懂测试又懂AI模型,学习曲线较陡
  • 大模型评测难度大,指标设计复杂,可能需要处理模糊问题和不确定性
  • 适合对AI质量保障有浓厚兴趣、具备良好测试功底和一定编程能力、愿意深入大模型领域的技术型人才

缺点 / 挑战

  • 大厂节奏快,可能面临较大的工作强度和交付压力

角色解读

  • 深耕AI质量保障领域,成为AI测评专家,负责更复杂的智能体评估体系设计
  • 向测试开发架构师方向发展,建设大规模自动化评测平台
  • 横向转岗至产品、算法或质量管理岗位,基于测评洞察影响产品方向
  • 负责企业级AI Agent/智能助手的测试与评估,设计评测方案和指标,覆盖对话理解、任务规划、工具调用等能力
  • 跟进Agent版本迭代,进行效果评估、基线对比、问题归因,输出测试报告和优化建议
  • 参与自动化评测脚本和平台建设,提升测试效率和覆盖率
  • 与产品、算法、研发协作,推动评测标准和质量闭环
  • 扎实的测试功底:需求分析、测试设计、问题定位和报告输出
  • 对大模型/Agent能力有了解,如意图理解、逻辑推理、指令遵循、幻觉等
  • 掌握至少一门编程语言(Python/Java/Go/Shell),能写自动化脚本或开发评测平台
  • 良好的沟通协作和逻辑分析能力,能独立推动问题解决

申请策略

  • 了解滴滴企业级事业部的业务方向,特别是AI Agent的应用场景
  • 在面试中体现出对质量保障体系的理解和对AI新领域的热情
  • 突出测试相关项目经验,特别是涉及AI/算法的测试或评估项目
  • 展示编程能力,如自动化测试框架开发、脚本编写、平台建设
  • 如果有大模型使用或测评经验,务必强调
  • 强调问题分析和归因能力,提供具体案例
  • 学习大模型基础知识,了解Agent的原理和应用场景,尝试使用主流LLM API
  • 熟悉常见的AI评测方法和指标,如BLEU、ROUGE、GPT评估等

面试指南

  • 对于评测设计问题,可以从场景拆解、指标定义、数据准备、执行流程、结果分析几个维度展开,体现系统性思维
  • 对于AI能力问题,结合具体技术原理和测试实践经验,展示理解深度和解决问题的能力
  • 对于项目经验问题,采用STAR法则(情境-任务-行动-结果)结构化表达
  • 如何设计一个Agent的评测方案?你会关注哪些指标?
  • 你如何理解LLM的“幻觉”问题?在测试中如何发现和度量?
  • 你做过最有挑战的测试项目是什么?如何解决?
  • 谈谈你对自动化评测平台的理解,如何设计一个可扩展的评测框架?
  • 当Agent的回复不正确但又不确定是Bug时,你会如何判断和推进?

职位点评

75
综合评分

上市大厂AI测评岗位,技术前沿,薪资优厚,但工作强度未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度、渴望接触AI前沿、愿意在快速迭代环境中成长的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活60
使命价值80

薪资福利

75中等

作为上市大厂,薪资福利稳定有保障,但具体薪酬未披露,需面议。

薪资信号未披露(AI估算:20K-35K/月)

成长发展

85较高

AI Agent测评是前沿方向,能接触最新技术,技能成长快,但职业晋升路径未在JD中明确。

技术前沿前沿/新兴技术
技术栈LLM、Agent、自动化测试、Python、评测平台
业务类型ambiguous

工作生活

60中等

工作地点在成都,办公模式未明确,JD未提及弹性或加班情况,生活节奏需自行判断。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

AI行业高速增长,智能助手提升办公效率,具有一定价值感,但JD未突出使命愿景。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs