Tencent logo
腾讯
混元语音大模型agentic评测(北京/上海)

混元语音大模型agentic评测(北京/上海)

发布于 大约 6 小时前

普通员工/个人贡献者

北京市 / 上海市
初级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Agentbench
Agent评测
Gaia
Mcp
任务规划
工具调用
语音大模型
Osworld
Webarena

AI 估算 · 25k–40k

腾讯大厂,Agent评测属于AI前沿方向,薪资竞争力强,2年经验对应中级水平,结合市场行情预估。

职位详情

关于这个职位

该职位负责混元语音大模型Agent的评测体系设计与落地,从0到1搭建面向复杂智能体场景的评测任务,涵盖多步推理、工具编排等核心维度

需要联动模型训练团队,推动模型能力迭代,并持续跟进学术界前沿技术
适合有Agent评测经验、精通Python和主流基准的候选人

最低要求

本科及以上学历,拥有 2 年及以上互联网 / 人工智能领域相关评测工作经验

具备从 0 到 1 独立设计 Agent Benchmark 完整实战经验,深刻理解评测数据集在区分度、数据抗污染、生态效度等维度的设计取舍与平衡
熟悉 WebArena、OSWorld、GAIA、AgentBench 等主流 Agent 评测基准,掌握各类评测集底层设计思路、适用场景与固有局限性
熟练使用 Python,具备扎实的数据处理、统计分析与数据可视化能力
熟悉主流大模型推理服务调用方式,了解相关工程落地约束
精通 Agent 主流框架核心机制,掌握 ReAct、工具调用(Tool Use)、任务规划(Planning)等经典范式,具备 MCP 等工具协议相关认知或项目实践经验
强结果导向,拥有良好的技术文档撰写能力,突出的跨团队沟通协调、项目推进落地能力

工作职责

主导 Agent 方向评测体系整体设计与落地实施,完成模型能力定义,搭建面向复杂智能体场景的评测任务体系

围绕多步推理、环境交互、工具编排、长程规划、异常错误恢复等核心维度,搭建贴合真实 Agentic 工作流的端到端评测方案
搭建评测数据全链路质量管控体系,落地试题查重、数据污染检测、难度分级标定校准、标注规范制定、标注一致性审核等机制,保障评测结果可信、稳定、可复现
联动模型训练团队深度对齐,提炼评测结论与优化洞察,输出模型能力迭代改进方向
协同工程团队推进评测基础设施建设,搭建可支撑高频次、大规模自动化评测的流水线
持续跟进 Agent 领域学术界、工业界前沿技术动态,输出评测体系迭代演进策略,持续优化评测方案,精准衡量大模型智能体真实能力边界
探索融合多模态能力的 Agentic 评测新思路、新方案,并完成方案验证与落地实施

AI 洞察

优缺点分析

优点

  • 腾讯大厂平台,资源丰富,项目影响力大,接触前沿大模型技术
  • Agent是AI热点方向,评测岗位核心且稀缺,技能积累价值高
  • 团队协同模型训练,能深度参与模型迭代,成长速度快
  • 评测体系从0到1搭建,需要较强的创新能力和系统性思维
  • 跨团队协作频繁,需要高效的沟通和推进能力
  • 大模型领域更新快,需持续学习保持技术敏感度

缺点 / 挑战

  • 适合有AI评测经验、热爱技术挑战、乐于推动模型进步的工程师

角色解读

  • 在Agent评测领域深耕,成为AI评测专家,主导大模型能力评估
  • 可转向模型训练或Agent产品研发方向,积累全栈AI经验
  • 随着大模型行业爆发,评测岗位稀缺性高,可晋升为技术主管或架构师
  • 设计并实施Agent评测体系,包括任务定义、数据集搭建和质量管控,确保评测可信稳定
  • 与模型训练团队紧密合作,分析评测结果,提出模型优化方向
  • 跟进Agent前沿技术,探索多模态评测新方案,推动评测基础设施建设
  • 扎实的Python编程能力,以及数据处理、统计分析和可视化技能
  • 熟悉主流Agent评测基准(如WebArena、GAIA)和Agent框架(如ReAct、Tool Use)
  • 具备从0到1设计Agent Benchmark的实战经验,理解评测数据集的设计取舍
  • 良好的跨团队沟通和项目推进能力,强结果导向

申请策略

  • 了解腾讯混元大模型的产品方向,在面试中展示对Agent评测的深度思考
  • 关注Agent领域最新论文和基准,准备对比分析观点
  • 突出独立设计Agent Benchmark的完整项目经验,说明数据集设计思路和成效
  • 详细列出熟悉的评测基准(如WebArena、GAIA)和实际应用案例
  • 展示Python数据处理和自动化评测流水线搭建能力,用数据量化成果
  • 强调跨团队合作推动模型优化的经历,体现沟通和落地能力
  • 补充MCP协议相关知识,了解Agent框架的最新进展
  • 学习多模态评测方法,阅读相关论文和开源项目

面试指南

  • STAR法则:情境、任务、行动、结果,结合具体项目数据
  • 问题分析框架:先定义问题,再拆解可能原因,最后给出解决方案和验证
  • 对比分析:准备两个不同基准的优缺点对比,展示深度理解
  • 请详细说明你从0到1设计一个Agent Benchmark的过程和关键决策
  • 如何评估一个评测数据集的质量?你遇到过数据污染问题吗?如何解决?
  • 谈谈你对ReAct、Tool Use等Agent范式的理解,以及它们在评测中的体现
  • 如果模型评测结果与预期不符,你会如何分析和定位问题?
  • 请描述一次成功推动模型优化的经历

职位点评

70
综合评分

前沿AI大厂Agent评测岗,技术成长极高,薪资可观,但WLB和办公灵活性一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和职业发展的求职者,能接受一定的加班和现场办公。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活50
使命价值70

薪资福利

65中等

薪资未明确但腾讯大厂通常提供有竞争力的薪酬和福利,但JD未披露具体数字,满足程度中等。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

90较高

职位专注于前沿的Agent评测技术,直接参与大模型能力迭代,成长空间极大。

技术前沿前沿/新兴技术
技术栈Python、Agent评测、WebArena、OSWorld、GAIA、AgentBench、ReAct、工具调用、任务规划、MCP、语音大模型
业务类型profit_center

工作生活

50较低

工作地点在北京/上海核心地段,但JD未提及远程或弹性工作,大厂可能存在加班,WLB一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

70中等

AI大模型是高速增长赛道,评测工作对技术发展有推动意义,但社会直接影响力有限。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs