AgiBot logo
智元机器人
【外包】模型评测与展会支持工程师

【外包】模型评测与展会支持工程师

发布于 大约 13 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Pytorch
Tensorflow
多模态
大模型评测
展会支持
机器人
自动化测试

AI 估算 · 15k–25k

该岗位要求2年+大模型评测经验,技术门槛较高,但外包属性限制薪资上限,上海生活成本高,综合评估月薪在15-25K。

职位详情

关于这个职位

该职位主要负责机器人大模型的对外展示支持(如全球展会)以及真机模型评测工作

你将参与大模型评测体系建设,制定测试计划,执行测试并输出专业报告,同时需要与产品和研发团队紧密协作
适合有评测经验、熟悉Linux和Python、能够接受频繁出差的工程师

最低要求

本科及以上学历,计算机、软件、机器人、自动化等相关专业

年及以上大模型评测或相关领域工作经验,对主流大模型的原理了解,可与策略等团队沟通
对机器学习、深度学习和相关人工智能技术有一定的理解,熟悉常见的机器学习框架如TensorFlow、PyTorch等
熟悉大模型的基本实现原理、熟悉各类公共评测集、了解多模态评测方法、有大模型评测及构建经验
具备优秀的代码基础和编程能力,至少掌握一门高级语言, 包括Shell、Python、C/C++、 Java
工作积极主动,具有良好的团队意识和敬业精神,能发挥主观能动性,有一定的抗压能力
因需要支持国内外展会需求,能接受较频繁国内外出差,英语口语较好者优先

工作职责

负责业务部对外demo展示支持,包括全球各个重大展会演示需求支持,能够独立部署、调试模型,确保模型能力达到对外展示效果,同时也需要接待客户讲解demo场景

在无展会期间,同时负责机器人真机模型评测,测试工作包括:对接算法评测需求,制定合理的测试计划,和研发对齐测试用例/metrics,执行测试,编写测试报告
深度参与大模型平台产品的测试与优化,协同产品与研发团队,高质量交付产品
参与大模型(包括不限于大语言模型、多模态大模型)评测体系建设,包括评测集管理、评测流程建设、评测工具需求定制与落地
负责大模型(包括基座模型和应用模型)评测,包括制定和完善评测方案、评测指标、评测数据收集和更新、评测执行,并输出专业评测报告
具备一定测试问题分析的能力和良好的沟通能力
遇到的问题,可自行解决/寻求协助解决,能给出自己的优化建议,对于测试中遇到的情况,能够灵活进行分析,找人沟通,给出各方信服的测试结论
具备在linux环境下工作的能力,能运行/编写测试脚本进行测试,有较强的文档规范编写能力
熟悉机器人真机测试是加分项目
之前在视觉模型、多模态模型方面,具备算法模型评测的一些经验
有自动驾驶相关实车测试或者模型评测相关经验是加分项
站在用户角度,对产品、算法发提出建设性的意见,在评测参与的各个流程中以用户视角保证产品体验
洞察行业及竞品情况,及时高效产出模型能力横评及竞品分析报告

优先资格

之前在视觉模型、多模态模型方面,具备算法模型评测的一些经验

有自动驾驶相关实车测试或者模型评测相关经验是加分项

AI 洞察

优缺点分析

优点

  • 身处机器人和大模型热门赛道,技术积累价值高,接触前沿多模态模型
  • 工作内容丰富,既有技术评测又有展会场景,锻炼综合能力
  • 公司处于B轮融资阶段,发展潜力大,有机会深入核心算法评测
  • 频繁国内外出差可能影响生活节奏,需要较强适应能力
  • 外包岗位稳定性相对较低,薪资福利可能不如正式员工
  • 适合技术功底扎实、喜欢动手实践、能适应出差和快节奏工作的工程师,希望在AI+机器人领域积累评测和项目经验

缺点 / 挑战

  • 评测工作可能需要承受一定压力,尤其是在展会前期的准备阶段

角色解读

  • 技术方向:从模型评测工程师向算法工程师或AI产品经理转型,积累大模型评测经验后可深入模型优化
  • 管理方向:随着经验增长,可成为评测团队负责人或测试架构师,主导评测体系建设
  • 跨领域机会:机器人+AI结合方向前景广阔,可向自动驾驶、通用机器人等方向延伸
  • 负责机器人真机模型评测,制定测试计划、执行测试并编写报告,确保模型性能达到展示要求
  • 支持全球展会demo演示,独立部署和调试模型,向客户讲解应用场景
  • 参与大模型评测体系建设,包括评测集管理、流程优化和工具定制,推动产品与研发团队协作
  • 跟踪行业竞品,输出模型能力横评报告,为算法优化提供建议
  • 熟练掌握Python/Shell等脚本语言,能在Linux环境下编写和执行测试脚本
  • 深入理解大模型原理及常见评测方法(如LLM、多模态),熟悉TensorFlow/PyTorch框架
  • 具备测试问题分析和文档编写能力,能够独立完成评测报告
  • 良好的沟通协作和抗压能力,能适应频繁国内外出差

申请策略

  • 在简历中明确写出可接受出差和外包形式,避免面试时产生误解
  • 展示对大模型前沿技术的热情,如关注最新论文或开源项目
  • 突出大模型评测项目经验,包括评测方案设计、指标制定、工具开发等具体案例
  • 强调Linux和Python能力,展示自动化测试脚本或评测框架搭建经历
  • 如果有自动驾驶或机器人测试经验,务必详细描述
  • 提及英语口语能力和出差经历,匹配JD中的展会支持需求
  • 补全主流大模型评测集(如MMLU、C-Eval等)的使用经验,学习评测工具如lm-eval-harness
  • 熟悉机器人操作系统(ROS)或仿真环境,为真机测试做准备

面试指南

  • STAR法则:描述情境、任务、行动、结果,突出评测过程中的量化成果
  • 技术深度:展示对评测指标(准确率、召回率、BLEU等)的理解,以及选择依据
  • 问题解决:强调故障排查步骤,如日志分析、环境对比、模型版本回溯等
  • 请描述一次你主导的大模型评测项目,包括测试方案、遇到的问题和最终结论
  • 如何设计一个多模态模型的评测方案?你会选择哪些指标?
  • 在Linux环境下,如何自动化执行一组模型测试并生成报告?请写出核心脚本思路
  • 如果展会现场模型表现不符合预期,你如何快速排查和解决?
  • 请比较几个主流大语言模型(如GPT-4、LLaMA)在中文场景下的表现差异

职位点评

49
综合评分

前沿技术积累丰富,但外包属性+频繁出差,适合奋斗型选手。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长、能接受出差和高强度工作的求职者,不适合看重工作生活平衡或稳定福利的人。
表现最好
成长发展
相对薄弱
工作生活
薪资福利45
成长发展80
工作生活30
使命价值70

薪资福利

45较低

外包岗位薪资竞争力一般,且福利未在JD中明确说明,频繁出差可能影响生活稳定性,补偿性动机满足度较低。

薪资信号未披露(AI估算:15K-25K/月)

成长发展

80较高

接触前沿大模型和机器人技术,参与评测体系建设,成长空间大,技术积累价值高。

技术前沿前沿/新兴技术
技术栈大模型评测、多模态、机器人、TensorFlow、PyTorch
业务类型profit_center

工作生活

30较低

频繁国内外出差带来较大生活压力,工作时间可能不固定,办公灵活性低,WLB较差。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

机器人+AI行业前景广阔,参与产品展示有直接影响力,但岗位本身偏支持性,使命感和创新感中等。

行业发展高速增长赛道
社会影响中性/一般
使命信号洞察行业及竞品情况
创新程度积极采用新技术
Watch Jobs