
智元机器人
数据软件开发工程师/专家
数据软件开发工程师/专家
发布于 大约 14 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
本科
软件工程
Argo Workflows
Clickhouse
Echarts
Foxglove
Go
Three.Js
Cvat
AI 估算 · 25k–45k
上海具身智能赛道,技术栈复杂,数据平台专家薪资竞争力强;B轮中大型企业,月薪25k-45k合理。
职位详情
关于这个职位
该职位面向具身数据工程,从0到1建设数据平台与配套软件系统,覆盖数据资产管理后端、数据生产管道、标注平台、数据前端、数据采集软件等多个方向
你将负责设计多模态数据ETL流水线、构建元数据管理、开发高性能数据采集软件等核心工作,是机器人数据闭环的关键角色
技术栈涉及Java/Go/Python、Spark/Flink、React/Vue等,适合有扎实工程能力和大数据经验的技术专家
最低要求
本科及以上,计算机、大数据、人工智能、自动化等相关专业
扎实的工程化能力与代码规范意识,熟悉 Linux 及 Shell
至少精通下列方向之一即可(无需覆盖全部):
)后端、平台:精通 Java、Go、Python、C++ 中至少一种,熟悉 RESTful API、RPC、消息队列、缓存、数据库事务与分布式系统设计
熟悉 MySQL、PostgreSQL、MongoDB、ClickHouse、Doris、Elasticsearch、Redis 等至少两类存储或检索组件并能合理选型
)大数据管道:精通 Python、Java、Scala 中至少一种,熟悉 Spark、Flink 与工作流编排工具(Argo Workflows、Airflow、Prefect 等),具备海量非结构化数据处理与调度经验
)标注平台:3 年以上平台、工具链或数据生产系统开发经验,全栈或后端能力扎实,熟悉任务调度、流程编排、权限与多租户管理
)前端:3 年以上前端开发经验,精通 TypeScript、JavaScript 及 React、Vue 之一,熟悉前端工程化与数据可视化(ECharts、G2、D3 等)
)数据采集软件:精通 C++、Python,熟悉高性能数据采集、多传感器时间同步
)具备独立设计并落地软件模块的能力,能兼顾交付效率、系统可扩展性与可维护性
工作职责
完成数据资产、数据批次、Clip、Dataset 等核心实体的后端建模、接口与服务开发,支持多模态数据资产的注册、查询、筛选、预览及全生命周期管理,涵盖归档状态与使用记录管理
设计元数据及相关模型,构建元数据从采集到变更记录的全流程能力,包括采集、解析、补全、校验、版本管理与变更记录
管控 Dataset 版本,实现冻结、发布、回滚、归档与恢复操作,建设数据血缘、输入输出关系追踪及影响范围分析体系,确保数据链路可追溯、可复现、可审计
负责后端模块与数据库设计,进行性能优化、稳定性治理与可观测性建设,建立单元测试、接口测试、数据一致性校验与故障恢复机制
设计并开发多模态原始数据的自动化 ETL 流水线,基于 Argo Workflows 编排数据处理全链路任务,优化大规模数据 IO 与流水线的性能及 SLA
建设与迭代多模态标注工具链和平台,涵盖标注界面、后端服务与数据存储,设计标注任务调度与质量管理流程,管控外包供应商,实现自动预标与人工精修模式,搭建标注质量评估与回流机制
搭建统一数据门户,支持多维度数据检索、筛选、拉取与导出,开发标注、任务管理与质量审核等界面,实现数据资产可视化
对接数据管道,开发流水线触发与运营操作界面,沉淀组件库与前端工程规范
开发面向多传感器的高性能数据采集软件,实现采集状态实时监控、多传感器时间同步、数据上传及源头数据校验
优先资格
有数据资产管理、元数据管理、数据目录、数据治理、湖仓或 DataOps 平台的建设经验
熟悉对象存储、Iceberg、DolphinScheduler、Ray
有 rosbag、MCAP 解析、Foxglove 可视化、LeRobot、HDF5、FFmpeg、OpenCV、流式 pipeline 经验
有多模态(图像、点云、视频)标注业务经验,了解 VLM 预标注、Online Labeling、难例挖掘
有多模态数据可视化(Three.js、deck.gl、WebGL、Foxglove)或标注工具链前端(CVAT、Label Studio 二次开发或自研)经验
有智驾、具身数据闭环经验,或处理过 Ego4D、Open X-Embodiment 等大规模数据集
AI 洞察
优缺点分析
优点
- 身处具身智能前沿赛道,公司(智元机器人)为明星创业公司,技术成长空间大
- 工作内容从0到1搭建数据平台,能深度参与系统架构设计与核心技术决策
- 技术栈覆盖后端、大数据、前端、采集等多个方向,可多维度提升综合能力
- 相关技术领域(如具身数据闭环)较为前沿,可借鉴经验较少,需要较强的自主探索能力
- 适合有3年以上后端或大数据经验、对机器人AI数据高兴趣、并且喜欢从0到1搭建系统的技术专家
缺点 / 挑战
- 岗位要求较高,需要同时具备工程化能力与业务理解力,对全栈或大数据能力有硬性要求
- 创业公司节奏快,可能面临较大交付压力与不确定性
角色解读
- 深耕数据工程方向,成为数据平台架构师或数据基础设施负责人
- 转向具身智能数据闭环领域,结合机器人业务发展为AI数据专家
- 横向拓展至全栈或AI工程化方向,成长为技术团队管理者
- 负责数据资产管理后端开发,构建多模态数据的注册、查询、筛选与全生命周期管理服务
- 设计并实现自动化ETL流水线,基于Argo Workflows编排大规模数据处理任务,保障性能与SLA
- 建设多模态标注工具链与平台,涵盖标注界面、后端服务、任务调度与质量管理流程
- 开发高性能数据采集软件,实现多传感器时间同步与实时状态监控
- 扎实的编程能力:精通Java/Go/Python/C++之一,熟悉后端开发、分布式系统与数据库设计
- 大数据技术栈:熟练使用Spark/Flink等计算框架,以及Argo Workflows/Airflow等调度工具
- 前端能力(适合方向):掌握TypeScript、React或Vue,具备数据可视化经验
- 系统设计能力:能独立设计并落地软件模块,兼顾效率、扩展性与可维护性
申请策略
- 在求职信中表达对机器人数据和AI基础设施的热情,展示对具身智能领域的理解
- 可提前了解智元机器人的技术博客或开源项目,在面试中体现对公司的研究和认同
- 突出数据平台/数据资产管理、ETL流水线、标注工具链等项目的设计与落地经验
- 展示在Java/Go/Python等语言上的深度,以及Spark/Flink等大数据组件的实际应用案例
- 若有数据可视化(Three.js/WebGL)或机器人数据处理(rosbag、Foxglove)经验,务必强调
- 强调独立负责模块、系统设计能力以及性能优化的成果(如提升吞吐、降低延迟等量化数据)
- 若缺失大数据管道经验,可快速学习Argo Workflows和Ray等工具,并动手搭建小型ETL项目
- 若方向为前端,建议补充Three.js或deck.gl等3D可视化技能,匹配多模态数据展示需求
面试指南
- STAR法则:描述具体场景、任务、行动和结果,突出个人贡献与设计决策
- 分层回答:先给出整体方案,再深入技术细节,最后总结可扩展性与业务价值
- 对比分析:如果遇到多种技术选型,说明权衡依据(如性能、可维护性、团队能力)
- 请描述你设计并实现的一个数据资产管理系统的架构,包括核心实体、元数据模型和接口设计
- 如何优化一个包含多模态数据的ETL流水线的性能?具体使用了哪些技术和策略?
- 在一个标注平台中,如何设计任务调度与质量管理流程以保障标注质量?
- 请谈谈你对具身数据闭环的理解,以及数据平台在其中扮演的角色
- 你如何处理多传感器数据的时间同步问题?请介绍相关算法或实践
职位点评
72
综合评分
前沿具身智能赛道,技术成长空间大,薪资有竞争力,但WLB不确定。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术快速成长和前沿AI领域探索的求职者,能接受创业公司的不确定性和一定的工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展88
工作生活40
使命价值80
薪资福利
75中等
上海中大型创业公司,薪资处于市场较高水平(25k-45k),但B轮阶段股票期权价值不确定,稳定性一般。
薪资信号未披露(AI估算:25K-45K/月)
成长发展
88较高
技术栈前沿(具身智能、大数据、多模态),从0到1建设平台成长空间大,但JD未明确提及晋升或培训体系。
技术前沿前沿/新兴技术
技术栈具身智能、多模态、ETL、Argo Workflows、Spark、Flink、元数据管理、数据血缘、Foxglove、rosbag
业务类型ambiguous
工作生活
40较低
仅现场办公,上海办公,未明确WLB信息,创业公司可能存在加班压力。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
具身智能是高速增长赛道,推动机器人AI发展具有正向社会影响力,但JD未强调使命愿景。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs