
滴滴出行
资深测试开发工程师(Agent测评工程师)
资深测试开发工程师(Agent测评工程师)
发布于 大约 2 小时前普通员工/个人贡献者
成都市
高级经验
全职员工
仅现场办公
本科
测试开发
Agent测评
Ai测试
Llm
多轮交互
大模型
测试开发
自动化测试
评测平台
质量保障
AI 估算 · 20k–35k
资深测试开发,AI测评方向人才稀缺,成都薪资合理,大厂福利补充,综合月薪2-3.5万。
职位详情
关于这个职位
作为滴滴出行企业级事业部的资深测试开发工程师,你将专注于AI Agent与智能助手的测评工作,设计评测方案与指标,覆盖对话理解、任务规划、工具调用等核心能力
你需要与产品、算法、研发团队紧密协作,推动评测标准建设和质量闭环,并参与自动化评测平台建设,提升测试效率
这是一个深入AI前沿领域、技术挑战大、成长空间广的岗位,适合对质量保障和人工智能交叉领域有浓厚兴趣的工程师
最低要求
具备 3 年及以上测试、AI 测评或质量保障相关经验
熟悉测试流程,具备良好的需求分析、测试设计、问题定位和报告输出能力
了解 LLM / Agent 常见能力与风险,如意图理解、逻辑推理、指令遵循、工具调用、幻觉、安全合规等
掌握 Python / Java / Go / Shell 等至少一种编程或脚本语言
具备良好的逻辑分析、沟通协作和学习能力,能独立推动问题闭环
工作职责
负责企业级 AI Agent / 智能助手的测评工作,包括需求分析、场景拆解、测试设计、用例编写与执行,保障产品质量
针对 Agent 业务场景,设计评测指标和评测方案,覆盖对话理解、任务规划、工具调用、多轮交互、结果准确性、异常处理等能力
跟进 Agent 版本迭代,进行效果评估、基线对比、问题归因和风险识别,输出测评报告及优化建议
参与自动化评测脚本、评测集和评测平台建设,提升测评效率和覆盖率
与产品、算法、研发团队协作,推动评测标准建设和质量问题闭环
优先资格
本科及以上学历优先,计算机、人工智能、软件工程、数学等相关专业优先
有大模型、Agent、智能助手测评经验优先
有自动化测试或评测平台建设经验优先
AI 洞察
优缺点分析
优点
- AI赛道热门,Agent测评是新兴方向,技术含金量高,积累稀缺经验
- 大厂平台,流程规范,有丰富的业务场景和技术资源
- 工作涉及多团队协作,能提升综合能力,有较好的职业发展空间
- 对技术深度要求高,需要既懂测试又懂AI模型,学习曲线较陡
- 大模型评测难度大,指标设计复杂,可能需要处理模糊问题和不确定性
- 适合对AI质量保障有浓厚兴趣、具备良好测试功底和一定编程能力、愿意深入大模型领域的技术型人才
缺点 / 挑战
- 大厂节奏快,可能面临较大的工作强度和交付压力
角色解读
- 深耕AI质量保障领域,成为AI测评专家,负责更复杂的智能体评估体系设计
- 向测试开发架构师方向发展,建设大规模自动化评测平台
- 横向转岗至产品、算法或质量管理岗位,基于测评洞察影响产品方向
- 负责企业级AI Agent/智能助手的测试与评估,设计评测方案和指标,覆盖对话理解、任务规划、工具调用等能力
- 跟进Agent版本迭代,进行效果评估、基线对比、问题归因,输出测试报告和优化建议
- 参与自动化评测脚本和平台建设,提升测试效率和覆盖率
- 与产品、算法、研发协作,推动评测标准和质量闭环
- 扎实的测试功底:需求分析、测试设计、问题定位和报告输出
- 对大模型/Agent能力有了解,如意图理解、逻辑推理、指令遵循、幻觉等
- 掌握至少一门编程语言(Python/Java/Go/Shell),能写自动化脚本或开发评测平台
- 良好的沟通协作和逻辑分析能力,能独立推动问题解决
申请策略
- 了解滴滴企业级事业部的业务方向,特别是AI Agent的应用场景
- 在面试中体现出对质量保障体系的理解和对AI新领域的热情
- 突出测试相关项目经验,特别是涉及AI/算法的测试或评估项目
- 展示编程能力,如自动化测试框架开发、脚本编写、平台建设
- 如果有大模型使用或测评经验,务必强调
- 强调问题分析和归因能力,提供具体案例
- 学习大模型基础知识,了解Agent的原理和应用场景,尝试使用主流LLM API
- 熟悉常见的AI评测方法和指标,如BLEU、ROUGE、GPT评估等
面试指南
- 对于评测设计问题,可以从场景拆解、指标定义、数据准备、执行流程、结果分析几个维度展开,体现系统性思维
- 对于AI能力问题,结合具体技术原理和测试实践经验,展示理解深度和解决问题的能力
- 对于项目经验问题,采用STAR法则(情境-任务-行动-结果)结构化表达
- 如何设计一个Agent的评测方案?你会关注哪些指标?
- 你如何理解LLM的“幻觉”问题?在测试中如何发现和度量?
- 你做过最有挑战的测试项目是什么?如何解决?
- 谈谈你对自动化评测平台的理解,如何设计一个可扩展的评测框架?
- 当Agent的回复不正确但又不确定是Bug时,你会如何判断和推进?
职位点评
75
综合评分
上市大厂AI测评岗位,技术前沿,薪资优厚,但工作强度未知。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术深度、渴望接触AI前沿、愿意在快速迭代环境中成长的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活60
使命价值80
薪资福利
75中等
作为上市大厂,薪资福利稳定有保障,但具体薪酬未披露,需面议。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
85较高
AI Agent测评是前沿方向,能接触最新技术,技能成长快,但职业晋升路径未在JD中明确。
技术前沿前沿/新兴技术
技术栈LLM、Agent、自动化测试、Python、评测平台
业务类型ambiguous
工作生活
60中等
工作地点在成都,办公模式未明确,JD未提及弹性或加班情况,生活节奏需自行判断。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
AI行业高速增长,智能助手提升办公效率,具有一定价值感,但JD未突出使命愿景。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
滴滴出行 的其他在招职位
相似职位推荐
Watch Jobs