Tencent logo
腾讯
生态发展部-资深游戏测试工程师-Agent评测

生态发展部-资深游戏测试工程师-Agent评测

发布于 大约 14 小时前

普通员工/个人贡献者

深圳市
高级经验
全职员工
仅现场办公
本科
软件工程
Ai Agent
Llm-As-A-Judge
大模型
游戏测试
自动化测试
评测
缺陷定界

AI 估算 · 25k–40k

腾讯大厂资深测试工程师,AI Agent方向稀缺,薪资具有竞争力,月薪中位数约32.5K。

职位详情

关于这个职位

作为腾讯生态发展部的资深游戏测试工程师,你将专注于AI Agent的全链路评测与质量保障,负责构建自动化评测基座、设计分级评测指标,并主导基准测试集的开发

这个职位需要深入理解大模型和AI Agent的逻辑,通过自动化脚本和大模型交叉验证提升评测效率,确保游戏服务的稳定性和用户体验

最低要求

本科及以上学历,计算机、软件工程、人工智能等相关专业,3年及以上测试开发/评测经验,具备大模型或AI Agent核心评测经验

深入理解大模型及AI Agent核心运行逻辑,能快速拆解Agent驱动游戏生成的业务链路
具备优秀的逻辑思维与缺陷定界能力,能基于生成日志、链路追踪工具快速定位复杂AI生成异常的根因
具备优秀的跨团队沟通协作能力和执行力,能高效对接算法、研发、产品团队,推动测试工作落地和问题闭环
精通至少一门编程语言,具备扎实的编码基础

工作职责

负责AI Agent全链路评测与质量保障工作,聚焦Agent能力基准测试、自动化评测基座建设及分级评测指标定义

针对AI生成的非确定性与参数化特点,设计并量化评测标准,搭建科学的分级评测指标体系
主导构建高质量的基准测试集(Benchmark),覆盖多轮交互、长短上下文等复杂场景,解决AI生成结果验证标准量化的核心难题
参与设计和研发Agent自动化评测基座,通过构建自动化测试脚本和引入大模型交叉验证(LLM-as-a-Judge)机制,提升评测效率
建立高效的缺陷定界机制,精准判断问题根因,输出多维度评测报告并协同开发团队推动问题解决

AI 洞察

优缺点分析

优点

  • 腾讯大厂平台,资源丰富,技术积累深厚,有利于个人职业品牌建立
  • AI Agent评测是前沿领域,技能稀缺,未来市场需求大
  • 工作内容丰富,涉及自动化、大模型、分布式系统等多技术栈,成长空间大
  • 需要与多个团队(算法、研发、产品)高频协作,沟通协调成本较大
  • 这个职位适合对AI与大模型技术有浓厚兴趣、善于逻辑分析和跨团队协作的测试开发工程师,尤其是希望在AI评测方向深耕的专业人士

缺点 / 挑战

  • AI生成结果具有非确定性,评测标准量化和缺陷定界难度较高,需要较强逻辑和耐心
  • 大厂工作节奏较快,可能面临一定的项目压力

角色解读

  • 在腾讯内部,可向测试架构师或质量专家方向发展,深入AI评测领域
  • 积累AI Agent评测经验后,可转向AI产品经理或算法相关岗位,拓宽职业路径
  • 行业上,AI评测是新兴方向,可成为该领域的资深专家,具备较高稀缺性
  • 负责AI Agent的全链路评测,包括构建基准测试集和自动化评测基座,确保Agent行为的稳定性和质量
  • 设计并量化AI生成结果的评测标准,通过大模型交叉验证等方法提升评测效率
  • 与算法、研发、产品团队紧密协作,快速定位并推动解决复杂AI异常问题
  • 精通至少一门编程语言(如Python),具备扎实的编码和自动化测试脚本开发能力
  • 深入理解大模型和AI Agent的工作原理,能够拆解Agent驱动的业务链路
  • 优秀的逻辑思维和缺陷定界能力,能通过日志和链路追踪工具定位根因
  • 跨团队沟通协作能力,推动测试工作落地和问题闭环

申请策略

  • 在面试中重点展示对AI生成结果质量评判的理解,可以准备一个自己设计的评测方案
  • 关注腾讯面试流程,通常有多轮技术面,准备好系统设计和算法题
  • 突出大模型或AI Agent相关的评测经验,包括具体项目、使用的工具和成果
  • 展示自动化测试框架设计经验,特别是与LLM结合的案例
  • 强调编程能力(Python等)和问题定位能力,可附上GitHub链接或技术博客
  • 提及跨团队协作经验,用具体事例说明推动问题解决的执行力
  • 深入学习大模型原理(如Transformer架构、RLHF)和Agent框架(如LangChain、AutoGPT)
  • 练习自动化评测工具开发,如使用pytest、unittest构建测试基座,了解LLM-as-a-Judge机制

面试指南

  • STAR法则:描述场景、任务、行动、结果,突出具体技术细节和量化成果
  • 分层思维:从评测指标定义、数据集构建、自动化流程、结果分析等层面系统阐述
  • 假设驱动:先提出可能的问题根因,再通过数据验证,展示逻辑推理能力
  • 如何设计一个AI Agent的自动化评测体系?
  • 面对AI生成结果的不确定性,你如何量化评测标准?
  • 描述一次你定位复杂AI异常的根因的经历
  • 如何平衡评测效率和准确性?
  • 你对大模型Agent的应用场景有哪些了解?

职位点评

71
综合评分

腾讯大厂,AI Agent前沿技术,薪资优厚,但现场办公且WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合注重技术成长和职业发展的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值60

薪资福利

75中等

腾讯大厂薪资福利有竞争力,但JD未明确薪资范围,福利也未提及,故评分中等偏上。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

85较高

职位涉及前沿AI Agent评测技术,成长空间大,但JD未明确提及晋升或培训,故评分较高但非满分。

技术前沿前沿/新兴技术
技术栈AI Agent、大模型、自动化评测、LLM-as-a-Judge、Benchmark
业务类型cost_center

工作生活

50较低

深圳现场办公,未提及弹性或WLB,大厂通常有加班文化,故评分一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

游戏与AI结合有一定社会价值,但JD未突出使命导向,评分中等。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs