
智元机器人
机器人交互数据与评测工程师
机器人交互数据与评测工程师
发布于 大约 1 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
仅现场办公
学历未注明
数据分析与科学
Llm
Sql
Vlm
大模型
数据处理
数据集构建
机器人交互
机器学习评测
AI 估算 · 20k–40k
该职位要求数据处理与机器学习评测技能,上海B轮公司薪资有竞争力,中级工程师月薪约20-40K。
职位详情
关于这个职位
该职位负责机器人交互数据的标注规范、评测体系建设和数据质量治理,通过日志分析和案例复现推动模型和系统迭代
你将与算法、工程团队紧密协作,确保训练数据、评测数据与回归集有效隔离,提升机器人交互的准确性和可靠性
最低要求
熟悉 Python、数据处理、JSON、Pandas、SQL 或常见数据工具
具备机器学习评测、数据集构建、实验分析、日志分析经验之一
能设计清晰的标签体系、指标体系和错误分类
能从 bad case 中判断问题归因
具备较强文档能力和结构化分析能力
对大模型、多模态、机器人交互有基本理解
工作职责
负责机器人交互数据 Schema、标签规范、数据版本和 Data Card 建设
建设 Gold Set、Hard Case Set、Regression Set,支持模型和交互系统版本回归
设计并维护评测指标,包括结构化输出合法率、字段准确率、回应对象准确率、主动误触发率、澄清成功率、首反馈延迟等
建立日志回放和 Case Replay 流程,支持 Demo 和 Shadow 问题复现
负责 Teacher Label、自动标注、人工抽检和数据质量治理
将模型和系统 bad case 转化为训练数据、评测样本或运行时规则改进项
保证训练集、评测集和回归集隔离,避免数据泄漏和指标虚高
与模型训练、交互系统、部署和表达团队协作,输出周度评测和数据闭环报告
优先资格
做过 benchmark、回放平台、实验平台、数据平台
做过大模型评测、VLM 评测、Agent 评测、RAG 评测
熟悉 LLM Judge、人工评审、hard case mining
熟悉可视化报表、日志检索、数据版本管理
有机器人、自动驾驶、智能座舱、语音交互、多模态系统评测经验
AI 洞察
优缺点分析
优点
- 参与前沿的机器人交互大模型领域,技术积累含金量高,行业前景广阔
- 工作内容涉及数据、评测、算法闭环,能全面了解AI产品研发流程,综合能力提升快
- 公司处于B轮融资阶段,发展迅速,有机会深度参与核心业务决策
- 对多维评测指标的拆解和bad case归因需要较强的逻辑能力和领域知识,学习曲线较陡
- 机器人交互系统仍在快速迭代,工作节奏可能较快,需要适应频繁调整
- 适合对AI评测和数据质量有热情、喜欢从数据中挖掘问题并推动改进的工程技术型人才
缺点 / 挑战
- 涉及与多个团队(算法、系统、部署)协作,沟通成本较高,需具备跨团队协调能力
角色解读
- 可向高级评测工程师或数据科学家方向发展,负责更复杂的评测体系与数据策略
- 积累机器人交互领域经验后,可转岗至算法或模型训练团队,成为AI产品专家
- 在机器人行业持续深耕,未来可担任数据团队负责人或技术Leader
- 负责机器人交互数据的Schema设计、标签规范和版本管理,确保数据体系清晰可用
- 建设Gold Set、Hard Case Set等评测集,设计并维护多维度的评测指标,如准确率、误触发率等
- 建立日志回放和Case Replay流程,用于复现和定位问题,推动交互系统改进
- 将bad case转化为训练数据、评测样本或规则改进项,并保证数据隔离避免泄漏
- 精通Python、Pandas、SQL等数据处理工具,能高效处理结构化数据
- 具备机器学习评测或数据集构建经验,能设计指标体系和标签规范
- 掌握日志分析、实验分析和bad case归因方法,能从数据中发现问题
- 具备较强的文档能力和结构化思维,能输出清晰的评测报告
申请策略
- 在简历中体现结构化分析和文档能力,例如附上过往的评测报告或数据规范文档样例
- 面试前了解智元机器人的产品线和技术方向,思考如何为现有交互系统设计评测指标
- 突出数据处理项目经验,如数据集构建、评测指标设计、日志分析等,展示具体成果
- 强调机器学习评测相关经历,如参与过benchmark、大模型评测或Agent评测
- 列出熟悉的数据工具栈(Python、Pandas、SQL等)和自动化流程(如回放平台)
- 如果有机机器人、自动驾驶、智能座舱等领域的评测经验,务必重点提及
- 学习大模型评测方法论,如LLM Judge、hard case mining、RAG评测等,提升专业匹配度
- 熟悉数据版本管理工具(如DVC、MLflow)和可视化报表工具(如Grafana、Metabase)
面试指南
- 对于评测指标设计,可先拆解交互场景(如唤醒、理解、响应),再定义具体的可量化指标,并说明各指标的重要性与权衡
- 处理bad case时,可按照“复现-归因-分类-转化”的框架:通过日志回放复现,分析是数据、模型还是规则问题,分类后分别转化为训练样本或规则改进
- 数据泄漏问题可以从时间隔离(按时间切分)、实体隔离(不同用户/场景)和内容去重(相似样本剔除)等角度回答
- 如何设计一套评测指标来评估机器人交互系统的性能?请举例说明
- 如果你发现某个bad case导致模型准确率下降,你会如何定位原因并转化为训练数据?
- 如何处理训练集、评测集和回归集之间的数据泄漏问题?
- 请描述你过去做过的数据集构建或评测项目,遇到的最大挑战是什么?
- 你如何理解机器人交互中的多模态数据?评测时需要注意哪些问题?
职位点评
68
综合评分
前沿机器人交互领域,强技术成长,高薪资潜力但WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和前沿领域、能接受现场办公和一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展85
工作生活50
使命价值80
薪资福利
60中等
该职位薪资未在JD中明确披露,但公司为B轮融资,上海地区中级工程师薪资通常在20K-40K,有一定竞争力。未提及福利,整体补偿性一般。
薪资信号未披露(AI估算:20K-40K/月)
成长发展
85较高
职位涉及前沿的大模型和机器人交互技术,能积累数据处理、评测、指标设计等核心技能,成长空间大。但JD未明确提及培训或晋升通道。
技术前沿前沿/新兴技术
技术栈Python、Pandas、SQL、LLM、VLM、数据处理、机器学习评测
业务类型ambiguous
工作生活
50较低
职位要求现场办公,未提及弹性工时或远程可能的迹象。上海办公地点未明确,但大概率在科技园或市区,通勤时间不确定。工作强度未说明,但创业公司节奏可能较快。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
机器人交互属于AI领域高速增长赛道,技术前沿且社会价值较高(改善人机交互体验)。职位直接参与产品改进,有较强使命感。但JD未明确强调社会影响。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs