AgiBot logo
智元机器人
模型评测测试工程师

模型评测测试工程师

发布于 大约 20 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
本科
软件工程
Pytorch
Tensorflow
多模态模型
大模型评测
测试自动化
机器人真机测试

AI 估算 · 15k–30k

上海B轮公司,大模型方向较热门,2年经验测试岗薪资有竞争力。

职位详情

关于这个职位

作为模型评测测试工程师,你将负责机器人真机模型的评测工作,制定测试计划、执行测试并输出报告

同时深度参与大模型平台产品的测试与优化,建设评测体系,进行竞品分析
这是一个结合算法理解与测试实践的技术岗位,适合对AI和机器人领域感兴趣的人

最低要求

本科及以上学历,计算机、软件、机器人、自动化等相关专业

年及以上大模型评测或相关领域工作经验,对主流大模型的原理了解,可与策略等团队沟通
对机器学习、深度学习和相关人工智能技术有一定的理解,熟悉常见的机器学习框架如TensorFlow、PyTorch等
熟悉大模型的基本实现原理、熟悉各类公共评测集、了解多模态评测方法、有大模型评测及构建经验
具备优秀的代码基础和编程能力,至少掌握一门高级语言,包括Shell、Python、C/C++、Java
工作积极主动,具有良好的团队意识和敬业精神,能发挥主观能动性,有一定的抗压能力

工作职责

负责机器人真机模型评测,测试工作包括:对接算法评测需求,制定合理的测试计划,和研发对齐测试用例/metrics,执行测试,编写测试报告

深度参与大模型平台产品的测试与优化,协同产品与研发团队,高质量交付产品
参与大模型(包括不限于大语言模型、多模态大模型)评测体系建设,包括评测集管理、评测流程建设、评测工具需求定制与落地
负责大模型(包括基座模型和应用模型)评测,包括制定和完善评测方案、评测指标、评测数据收集和更新、评测执行,并输出专业评测报告
具备一定测试问题分析的能力和良好的沟通能力
遇到的问题,可自行解决/寻求协助解决,能给出自己的优化建议,对于测试中遇到的情况,能够灵活进行分析,找人沟通,给出各方信服的测试结论
具备在linux环境下工作的能力,能运行/编写测试脚本进行测试,有较强的文档规范编写能力
之前在视觉模型、多模态模型方面,具备算法模型评测的一些经验
站在用户角度,对产品、算法发提出建设性的意见,在评测参与的各个流程中以用户视角保证产品体验
洞察行业及竞品情况,及时高效产出模型能力横评及竞品分析报告

优先资格

之前在视觉模型、多模态模型方面,具备算法模型评测的一些经验

有自动驾驶相关实车测试或者模型评测相关经验是加分项

AI 洞察

优缺点分析

优点

  • 身处大模型和机器人高增长赛道,技术积累价值高
  • 参与前沿项目,能深入了解大模型评测全流程
  • 公司处于B轮,有较大成长空间和股权激励可能
  • 需要同时掌握测试技能和算法理解,技术面较广
  • 真机测试涉及硬件,可能面临调试复杂度和环境搭建问题
  • 快速迭代的项目节奏,可能有一定抗压要求
  • 适合对AI和机器人有热情、具备编程能力的测试工程师,希望深耕大模型评测领域

缺点 / 挑战

暂无明显挑战项

角色解读

  • 可以往高级测试工程师或测试专家发展,专注大模型评测领域
  • 也可转型为算法工程师,深入参与模型优化
  • 积累机器人+AI经验,未来可走向技术管理或产品方向
  • 负责机器人真机模型评测,制定测试计划和用例,执行测试并编写报告
  • 深度参与大模型平台产品的测试优化,协同研发与产品保证交付质量
  • 建设评测体系,包括评测集管理、流程优化和工具落地
  • 进行竞品分析和模型横评,输出专业分析报告
  • 精通至少一种编程语言(Python/Shell/C++等),能编写测试脚本
  • 熟悉大模型原理、公共评测集和多模态评测方法
  • 具备机器学习框架使用经验(TensorFlow/PyTorch)
  • 良好的问题分析和沟通能力,能推动测试问题解决

申请策略

  • 关注智元机器人的产品方向(具身智能),在面试前了解其机器人技术特点
  • 准备一个自己主导的评测案例,说明测试设计、执行过程和业务影响
  • 突出大模型评测或相关AI测试项目经历,展示对评测方法的理解
  • 强调编程能力和自动化测试经验,尤其是Linux脚本和Python
  • 如有机器人或自动驾驶相关测试经验,务必重点描述
  • 展示结果导向:如何通过测试提升模型质量或发现问题
  • 补充大模型评测框架(如HELM、LM Eval Harness)的使用经验
  • 学习多模态模型基础知识,了解常见评测集(如MMBench)

面试指南

  • 从测试目标出发,明确评测指标(准确性、鲁棒性等),再选择或设计评测集
  • 结合技术细节,如使用的框架、编写的脚本,突出系统性思考
  • 用STAR法则(情境、任务、行动、结果)回答行为问题
  • 如何设计一个大语言模型的评测方案?请举例说明
  • 在真机测试中,如果模型表现不稳定,你怎么排查问题?
  • 你用过哪些机器学习和深度学习框架?如何利用它们进行模型评测?
  • 描述一次你通过测试发现关键bug并推动修复的经历
  • 你对多模态评测有什么了解?如何评估多模态模型的效果?

职位点评

63
综合评分

B轮机器人公司,模型评测技术岗,前沿技术栈,可成长但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
优先重视技能成长和行业前沿的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展75
工作生活50
使命价值65

薪资福利

60中等

薪资未明确披露,但上海B轮公司测试岗通常处于市场水准,福利未提及,故补偿性动机满足中等。

薪资信号未披露(AI估算:15K-30K/月)

成长发展

75中等

职位涉及前沿大模型和机器人技术,有丰富的学习和成长空间,但未明确提到培训或晋升路径。

技术前沿前沿/新兴技术
技术栈大模型、多模态、机器人、TensorFlow、PyTorch、Linux
业务类型profit_center

工作生活

50较低

仅现场办公,工作地点未明确,未提及弹性工时或WLB,可能需要配合研发节奏,对生活化动机满足有限。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

机器人+大模型属于高速增长赛道,具有一定社会价值(推动AI落地),但岗位偏测试,直接使命感不强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs