
腾讯
AI高级评测工程师
AI高级评测工程师
发布于 大约 7 小时前普通员工/个人贡献者
深圳市
高级经验
全职员工
仅现场办公
本科
质量管理
Ai评测
Llm-As-A-Judge
Prompt Engineering
Rag
医疗Ai
大模型
测试开发
自动化评测
AI 估算 · 30k–50k
腾讯高级工程师岗位,结合AI行业热点,薪资高于市场平均水平,考虑技术难度和公司平台。
职位详情
关于这个职位
作为腾讯AI高级评测工程师,你将专注于医疗Agent核心业务的质量保障,覆盖健康问问、AI诊室等场景
你需要制定全链路评测方案,建设评测指标和自动化工具,并建立线上Badcase治理闭环
这个岗位深度结合AI大模型技术与质量保证,适合对AI产品测试有热情、具备工程化能力的资深测试人员
最低要求
计算机或相关专业本科及以上学历,具备扎实的软件测试与质量保证基础,有大型复杂系统、AI产品或算法评测相关经验,能够独立负责核心模块或专项评测方向
具备AI评测实战经验,熟悉大模型应用或Agent类产品的评测方法,能够围绕非确定性输出、复杂任务链路和多轮交互过程设计评测指标、测试集、验收标准、质量准出策略和回归评测方案
深入理解LLM/大模型技术原理,熟悉Agent、RAG、Prompt Engineering、工具调用、工作流编排等大模型应用架构,能够识别模型能力、业务策略、工具链路和系统工程中的质量风险
熟练掌握主流大模型与Agent评测方法,包括客观指标自动化评测、主观人工标注对齐、链路Trace分析、工具调用评测、模型互评机制、LLM-as-a-Judge等,能够建设可复用的评测方法和质量判断标准
具备优秀的工程化与数据分析能力,熟悉Python或其他脚本语言,能够独立开发数据处理脚本、自动化评测工具和评测结果分析能力
能够从对话日志、Agent Trace、工具调用记录、评测结果、用户反馈和线上Badcase中完成复杂问题分析、体系化归因和闭环推动
工作职责
负责医疗 Agent 核心业务的质量评测工作,覆盖健康问问、AI 诊室、医保智能助手等场景,制定 Agent 全链路评测方案、准出标准、回归策略与质量风险判断机制
建设医疗 Agent 评测指标体系,围绕意图理解、任务完成度、多轮追问有效性、信息收集完整性、工具调用准确性、RAG 检索与引用质量、结果生成质量、兜底与异常处理等维度进行系统化评估
负责医疗复杂链路专项评测,包括 AI 问诊全流程、科室/服务匹配、医保政策问答与办理指引、多模态报告解读等场景,沉淀可量化、可复用的评测方法和评估标准
推动 Agent 自动化评测与数据基准建设,建设高质量评测集、标准答案、链路 Trace 标注规范和评测流水线,结合人工评测、规则评测、自动化评测和 LLM-as-a-Judge 提升评测效率与稳定性
建立线上 Badcase 分析与治理闭环,针对医疗安全、内容安全、隐私合规、诊疗建议边界等高风险问题,设计安全护栏评测策略,并推动算法、产品和研发团队持续优化
AI 洞察
优缺点分析
优点
- 深入参与前沿AI产品(医疗Agent)的质量保障,积累大模型评测核心经验
- 腾讯平台提供丰富的资源和数据,技术成长空间大
- 薪资福利优厚,包括年终奖、股票等
- 医疗AI赛道前景广阔,符合行业发展趋势
- 大模型输出非确定性,评测设计复杂,需要创新方法
- 医疗领域对安全、隐私要求高,工作严谨性强
- 需要跨团队协作,推动问题解决可能涉及多方沟通
- 适合对大模型技术充满热情、有较强工程能力和质量意识的资深测试工程师,愿意在AI评测领域深入发展
缺点 / 挑战
暂无明显挑战项
角色解读
- 在AI评测领域深耕,成为质量保障专家,主导大模型产品评测方法论
- 可转向AI算法或产品方向,积累对模型和业务的理解
- 在腾讯内部晋升为测试团队负责人或质量架构师
- 负责医疗Agent核心业务的质量评测,包括制定评测方案、准出标准和回归策略
- 建设评测指标体系,从意图理解、任务完成度等多维度评估模型表现
- 推动自动化评测与数据基准建设,提升评测效率
- 建立线上Badcase分析闭环,驱动算法和产品优化
- 扎实的软件测试和质量保证基础,熟悉大模型或AI产品评测方法
- 深入理解LLM技术原理,包括Agent、RAG、Prompt Engineering等架构
- 优秀的工程化能力,熟练使用Python开发自动化工具和数据分析脚本
- 具备复杂问题分析和体系化归因能力,能从日志、Trace中定位问题
申请策略
- 在简历中使用项目案例说明如何评测非确定性输出、设计自动化回归
- 面试前准备1-2个评测方案设计案例,展示结构化思维
- 突出AI产品评测经验,尤其是大模型或Agent类项目的评测方法
- 展示工程化能力:Python开发、自动化工具搭建、数据分析项目
- 强调在复杂系统质量保障中的成果,如主导评测方案设计、推动闭环改进
- 如有医疗领域或安全合规经验,务必重点提及
- 系统学习RAG、Agent、Prompt Engineering等大模型应用架构
- 掌握LLM-as-a-Judge等主流评测方法,可阅读相关论文或开源项目
面试指南
- 采用目标-指标-方法框架:先明确评测目标(如准确性、安全性),再分解可量化指标,最后选择合适方法(自动化/人工/LLM评判)
- 分析问题本质:区分模型能力、业务策略、系统工程三类风险,给出针对性检测方法
- 结合具体案例,展示从发现问题、根因分析到推动改进的完整闭环
- 请设计一个医疗Agent对话的评测方案,包括指标、测试集和准出标准
- 如何评估大模型在多轮对话中的工具调用准确性?
- 线上出现Badcase如何分析并推动闭环?举例说明
- LLM-as-a-Judge有哪些优缺点?如何保证评测质量?
- 你对医疗AI的安全合规有哪些理解?如何设计安全护栏评测?
职位点评
77
综合评分
腾讯AI高级评测工程师,前沿技术栈、高薪资潜力,但现场办公且WLB不确定。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合看重技术成长和职业发展的求职者,尤其是希望深入AI评测领域的人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活50
使命价值70
薪资福利
85较高
腾讯提供有竞争力的薪资福利,包括股票和年终奖,但JD未明确薪资范围,薪酬信号为未披露;福利方面JD未提及具体项目。整体补偿性动机满足较好。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
该职位涉及前沿AI技术(大模型、Agent、RAG),能深度参与技术迭代,成长空间大,但JD未明确提及晋升通道或培训。发展性动机满足度高。
技术前沿前沿/新兴技术
技术栈LLM、Agent、RAG、Prompt Engineering、LLM-as-a-Judge、Python
业务类型profit_center
工作生活
50较低
工作地点为深圳腾讯总部,仅现场办公,JD未提及弹性或远程,也未说明加班情况。生活化动机满足一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
70中等
医疗AI直接改善用户健康,社会意义较强,但JD未突出使命愿景。属于高速增长的AI医疗赛道,创新性高。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
腾讯 的其他在招职位
相似职位推荐
Watch Jobs