
腾讯
混元语音大模型agentic评测(北京/上海)
混元语音大模型agentic评测(北京/上海)
发布于 大约 6 小时前普通员工/个人贡献者
北京市 / 上海市
初级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Agentbench
Agent评测
Gaia
Mcp
任务规划
工具调用
语音大模型
Osworld
Webarena
AI 估算 · 25k–40k
腾讯大厂,Agent评测属于AI前沿方向,薪资竞争力强,2年经验对应中级水平,结合市场行情预估。
职位详情
关于这个职位
该职位负责混元语音大模型Agent的评测体系设计与落地,从0到1搭建面向复杂智能体场景的评测任务,涵盖多步推理、工具编排等核心维度
需要联动模型训练团队,推动模型能力迭代,并持续跟进学术界前沿技术
适合有Agent评测经验、精通Python和主流基准的候选人
最低要求
本科及以上学历,拥有 2 年及以上互联网 / 人工智能领域相关评测工作经验
具备从 0 到 1 独立设计 Agent Benchmark 完整实战经验,深刻理解评测数据集在区分度、数据抗污染、生态效度等维度的设计取舍与平衡
熟悉 WebArena、OSWorld、GAIA、AgentBench 等主流 Agent 评测基准,掌握各类评测集底层设计思路、适用场景与固有局限性
熟练使用 Python,具备扎实的数据处理、统计分析与数据可视化能力
熟悉主流大模型推理服务调用方式,了解相关工程落地约束
精通 Agent 主流框架核心机制,掌握 ReAct、工具调用(Tool Use)、任务规划(Planning)等经典范式,具备 MCP 等工具协议相关认知或项目实践经验
强结果导向,拥有良好的技术文档撰写能力,突出的跨团队沟通协调、项目推进落地能力
工作职责
主导 Agent 方向评测体系整体设计与落地实施,完成模型能力定义,搭建面向复杂智能体场景的评测任务体系
围绕多步推理、环境交互、工具编排、长程规划、异常错误恢复等核心维度,搭建贴合真实 Agentic 工作流的端到端评测方案
搭建评测数据全链路质量管控体系,落地试题查重、数据污染检测、难度分级标定校准、标注规范制定、标注一致性审核等机制,保障评测结果可信、稳定、可复现
联动模型训练团队深度对齐,提炼评测结论与优化洞察,输出模型能力迭代改进方向
协同工程团队推进评测基础设施建设,搭建可支撑高频次、大规模自动化评测的流水线
持续跟进 Agent 领域学术界、工业界前沿技术动态,输出评测体系迭代演进策略,持续优化评测方案,精准衡量大模型智能体真实能力边界
探索融合多模态能力的 Agentic 评测新思路、新方案,并完成方案验证与落地实施
AI 洞察
优缺点分析
优点
- 腾讯大厂平台,资源丰富,项目影响力大,接触前沿大模型技术
- Agent是AI热点方向,评测岗位核心且稀缺,技能积累价值高
- 团队协同模型训练,能深度参与模型迭代,成长速度快
- 评测体系从0到1搭建,需要较强的创新能力和系统性思维
- 跨团队协作频繁,需要高效的沟通和推进能力
- 大模型领域更新快,需持续学习保持技术敏感度
缺点 / 挑战
- 适合有AI评测经验、热爱技术挑战、乐于推动模型进步的工程师
角色解读
- 在Agent评测领域深耕,成为AI评测专家,主导大模型能力评估
- 可转向模型训练或Agent产品研发方向,积累全栈AI经验
- 随着大模型行业爆发,评测岗位稀缺性高,可晋升为技术主管或架构师
- 设计并实施Agent评测体系,包括任务定义、数据集搭建和质量管控,确保评测可信稳定
- 与模型训练团队紧密合作,分析评测结果,提出模型优化方向
- 跟进Agent前沿技术,探索多模态评测新方案,推动评测基础设施建设
- 扎实的Python编程能力,以及数据处理、统计分析和可视化技能
- 熟悉主流Agent评测基准(如WebArena、GAIA)和Agent框架(如ReAct、Tool Use)
- 具备从0到1设计Agent Benchmark的实战经验,理解评测数据集的设计取舍
- 良好的跨团队沟通和项目推进能力,强结果导向
申请策略
- 了解腾讯混元大模型的产品方向,在面试中展示对Agent评测的深度思考
- 关注Agent领域最新论文和基准,准备对比分析观点
- 突出独立设计Agent Benchmark的完整项目经验,说明数据集设计思路和成效
- 详细列出熟悉的评测基准(如WebArena、GAIA)和实际应用案例
- 展示Python数据处理和自动化评测流水线搭建能力,用数据量化成果
- 强调跨团队合作推动模型优化的经历,体现沟通和落地能力
- 补充MCP协议相关知识,了解Agent框架的最新进展
- 学习多模态评测方法,阅读相关论文和开源项目
面试指南
- STAR法则:情境、任务、行动、结果,结合具体项目数据
- 问题分析框架:先定义问题,再拆解可能原因,最后给出解决方案和验证
- 对比分析:准备两个不同基准的优缺点对比,展示深度理解
- 请详细说明你从0到1设计一个Agent Benchmark的过程和关键决策
- 如何评估一个评测数据集的质量?你遇到过数据污染问题吗?如何解决?
- 谈谈你对ReAct、Tool Use等Agent范式的理解,以及它们在评测中的体现
- 如果模型评测结果与预期不符,你会如何分析和定位问题?
- 请描述一次成功推动模型优化的经历
职位点评
70
综合评分
前沿AI大厂Agent评测岗,技术成长极高,薪资可观,但WLB和办公灵活性一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长和职业发展的求职者,能接受一定的加班和现场办公。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活50
使命价值70
薪资福利
65中等
薪资未明确但腾讯大厂通常提供有竞争力的薪酬和福利,但JD未披露具体数字,满足程度中等。
薪资信号未披露(AI估算:25K-40K/月)
成长发展
90较高
职位专注于前沿的Agent评测技术,直接参与大模型能力迭代,成长空间极大。
技术前沿前沿/新兴技术
技术栈Python、Agent评测、WebArena、OSWorld、GAIA、AgentBench、ReAct、工具调用、任务规划、MCP、语音大模型
业务类型profit_center
工作生活
50较低
工作地点在北京/上海核心地段,但JD未提及远程或弹性工作,大厂可能存在加班,WLB一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
70中等
AI大模型是高速增长赛道,评测工作对技术发展有推动意义,但社会直接影响力有限。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
腾讯 的其他在招职位
相似职位推荐
Watch Jobs