
腾讯
生态发展部-资深游戏测试工程师-Agent评测
生态发展部-资深游戏测试工程师-Agent评测
发布于 大约 14 小时前普通员工/个人贡献者
深圳市
高级经验
全职员工
仅现场办公
本科
软件工程
Ai Agent
Llm-As-A-Judge
大模型
游戏测试
自动化测试
评测
缺陷定界
AI 估算 · 25k–40k
腾讯大厂资深测试工程师,AI Agent方向稀缺,薪资具有竞争力,月薪中位数约32.5K。
职位详情
关于这个职位
作为腾讯生态发展部的资深游戏测试工程师,你将专注于AI Agent的全链路评测与质量保障,负责构建自动化评测基座、设计分级评测指标,并主导基准测试集的开发
这个职位需要深入理解大模型和AI Agent的逻辑,通过自动化脚本和大模型交叉验证提升评测效率,确保游戏服务的稳定性和用户体验
最低要求
本科及以上学历,计算机、软件工程、人工智能等相关专业,3年及以上测试开发/评测经验,具备大模型或AI Agent核心评测经验
深入理解大模型及AI Agent核心运行逻辑,能快速拆解Agent驱动游戏生成的业务链路
具备优秀的逻辑思维与缺陷定界能力,能基于生成日志、链路追踪工具快速定位复杂AI生成异常的根因
具备优秀的跨团队沟通协作能力和执行力,能高效对接算法、研发、产品团队,推动测试工作落地和问题闭环
精通至少一门编程语言,具备扎实的编码基础
工作职责
负责AI Agent全链路评测与质量保障工作,聚焦Agent能力基准测试、自动化评测基座建设及分级评测指标定义
针对AI生成的非确定性与参数化特点,设计并量化评测标准,搭建科学的分级评测指标体系
主导构建高质量的基准测试集(Benchmark),覆盖多轮交互、长短上下文等复杂场景,解决AI生成结果验证标准量化的核心难题
参与设计和研发Agent自动化评测基座,通过构建自动化测试脚本和引入大模型交叉验证(LLM-as-a-Judge)机制,提升评测效率
建立高效的缺陷定界机制,精准判断问题根因,输出多维度评测报告并协同开发团队推动问题解决
AI 洞察
优缺点分析
优点
- 腾讯大厂平台,资源丰富,技术积累深厚,有利于个人职业品牌建立
- AI Agent评测是前沿领域,技能稀缺,未来市场需求大
- 工作内容丰富,涉及自动化、大模型、分布式系统等多技术栈,成长空间大
- 需要与多个团队(算法、研发、产品)高频协作,沟通协调成本较大
- 这个职位适合对AI与大模型技术有浓厚兴趣、善于逻辑分析和跨团队协作的测试开发工程师,尤其是希望在AI评测方向深耕的专业人士
缺点 / 挑战
- AI生成结果具有非确定性,评测标准量化和缺陷定界难度较高,需要较强逻辑和耐心
- 大厂工作节奏较快,可能面临一定的项目压力
角色解读
- 在腾讯内部,可向测试架构师或质量专家方向发展,深入AI评测领域
- 积累AI Agent评测经验后,可转向AI产品经理或算法相关岗位,拓宽职业路径
- 行业上,AI评测是新兴方向,可成为该领域的资深专家,具备较高稀缺性
- 负责AI Agent的全链路评测,包括构建基准测试集和自动化评测基座,确保Agent行为的稳定性和质量
- 设计并量化AI生成结果的评测标准,通过大模型交叉验证等方法提升评测效率
- 与算法、研发、产品团队紧密协作,快速定位并推动解决复杂AI异常问题
- 精通至少一门编程语言(如Python),具备扎实的编码和自动化测试脚本开发能力
- 深入理解大模型和AI Agent的工作原理,能够拆解Agent驱动的业务链路
- 优秀的逻辑思维和缺陷定界能力,能通过日志和链路追踪工具定位根因
- 跨团队沟通协作能力,推动测试工作落地和问题闭环
申请策略
- 在面试中重点展示对AI生成结果质量评判的理解,可以准备一个自己设计的评测方案
- 关注腾讯面试流程,通常有多轮技术面,准备好系统设计和算法题
- 突出大模型或AI Agent相关的评测经验,包括具体项目、使用的工具和成果
- 展示自动化测试框架设计经验,特别是与LLM结合的案例
- 强调编程能力(Python等)和问题定位能力,可附上GitHub链接或技术博客
- 提及跨团队协作经验,用具体事例说明推动问题解决的执行力
- 深入学习大模型原理(如Transformer架构、RLHF)和Agent框架(如LangChain、AutoGPT)
- 练习自动化评测工具开发,如使用pytest、unittest构建测试基座,了解LLM-as-a-Judge机制
面试指南
- STAR法则:描述场景、任务、行动、结果,突出具体技术细节和量化成果
- 分层思维:从评测指标定义、数据集构建、自动化流程、结果分析等层面系统阐述
- 假设驱动:先提出可能的问题根因,再通过数据验证,展示逻辑推理能力
- 如何设计一个AI Agent的自动化评测体系?
- 面对AI生成结果的不确定性,你如何量化评测标准?
- 描述一次你定位复杂AI异常的根因的经历
- 如何平衡评测效率和准确性?
- 你对大模型Agent的应用场景有哪些了解?
职位点评
71
综合评分
腾讯大厂,AI Agent前沿技术,薪资优厚,但现场办公且WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合注重技术成长和职业发展的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展85
工作生活50
使命价值60
薪资福利
75中等
腾讯大厂薪资福利有竞争力,但JD未明确薪资范围,福利也未提及,故评分中等偏上。
薪资信号未披露(AI估算:25K-40K/月)
成长发展
85较高
职位涉及前沿AI Agent评测技术,成长空间大,但JD未明确提及晋升或培训,故评分较高但非满分。
技术前沿前沿/新兴技术
技术栈AI Agent、大模型、自动化评测、LLM-as-a-Judge、Benchmark
业务类型cost_center
工作生活
50较低
深圳现场办公,未提及弹性或WLB,大厂通常有加班文化,故评分一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
游戏与AI结合有一定社会价值,但JD未突出使命导向,评分中等。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs