
智元机器人
大模型数据工程师
大模型数据工程师
发布于 大约 13 小时前普通员工/个人贡献者
深圳市 / 上海市
中级经验
全职员工
仅现场办公
本科
信息技术与基础设施
Aigc
Pipeline
分布式系统
多模态
大模型
数据增强
数据工程
数据质量
机器人
AI 估算 · 20k–35k
大模型数据工程师岗位稀缺,AI行业薪资偏高,深圳上海生活成本高,综合公司B轮融资阶段估算。
职位详情
关于这个职位
本职位负责为人形机器人交互搭建大规模多模态数据处理系统,涵盖数据采集、清洗、管道构建及质量监控,是多模态大模型训练的关键支撑
你将与算法团队合作,优化数据增强策略,提升机器人感知与表达能力,适合对数据质量有极致追求、热爱大模型和机器人技术的工程师
最低要求
本科及以上学历,计算机、人工智能、电子、数学等相关专业
出色的问题分析和解决能力,自主探索新解决方案的能力强
关注生成式 AI 和多模态交互技术,对推动人形机器人智能化有热情
对数据质量有极致追求,具备敏锐的数据洞察力,能精准识别数据中的噪声、偏差、标注错误及潜在风险
深刻理解数据质量对模型效果(如幻觉、偏见、鲁棒性)的关键影响,并能在数据处理全流程中落实严格的质量控制标准
工作职责
搭建面向人形机器人交互的大规模多模态数据处理系统,支持语音、图像、视频、动作等模态的自动化采集、筛选与结构化管理
构建高吞吐、低延迟的数据解码与加载 pipeline,为多模态大模型的高效训练与评估提供基础设施
设计数据分布分析与偏差检测机制,发现数据覆盖盲区,优化机器人在真实场景中的感知与表达能力
联合算法团队制定数据增强与扩展策略,提升交互模型在人设稳定性、多模态一致性方面的表现
开发数据可视化与管理工具,支持数据版本追踪与跨模态数据闭环建设
优先资格
有机器人场景(如语音交互、视觉引导、动作合成)下的数据支持经验
在多模态、大模型、基础模型、世界模型、RL、渲染生成领域,有影响力项目的数据建设经验
在计算机视觉、多模态、AIGC、机器学习、渲染生成等一个或多个领域有较深入的研究者
AI 洞察
优缺点分析
优点
- 参与前沿的大模型+人形机器人项目,技术天花板高,积累核心经验
- 以数据为中心,可深入理解模型训练全流程,技术纵深强
- 公司处于快速成长期(B轮),发展空间大,有机会获得股权激励
- 薪资待遇在AI领域有竞争力,福利体系完善
- 领域交叉性强,需同时掌握数据工程、机器人和AI知识,学习曲线陡峭
缺点 / 挑战
- 多模态数据量巨大,处理复杂度高,需应对实时性与分布式挑战
- 数据质量直接影响模型效果,工作压力较大,对细节要求严苛
- 适合对数据有极致追求、热爱挑战、对AI和机器人充满热情,并愿意在数据工程领域深耕的工程师
角色解读
- 向大模型数据架构师发展,主导整个数据基础设施的设计与优化
- 向算法工程师转型,深入参与模型训练与调优,成为数据与算法的桥梁
- 成为数据科学家,专注数据分布分析与策略研究,推动模型性能突破
- 搭建大规模多模态数据处理系统,涵盖语音、图像、视频等多种模态的数据采集、清洗与结构化
- 构建高吞吐、低延迟的数据解码与加载管道,支撑多模态大模型的高效训练与评估
- 设计数据分布分析与偏差检测机制,优化机器人在真实场景中的感知与表达能力
- 联合算法团队制定数据增强与扩展策略,提升模型在多模态一致性上的表现
- 熟悉数据处理管道和大数据工具(如Spark、Flink、Kafka等),具备分布式系统开发经验
- 掌握多模态数据特点,了解语音、图像、视频等数据的处理与对齐技术
- 编程能力强,精通Python,熟悉C++或Java更佳,能高效实现数据处理逻辑
- 对数据质量有极高敏感度,能设计自动化质量监控与偏差检测机制
申请策略
- 在求职信中表达对人形机器人交互的热情和对数据质量的态度,结合自身经历说明如何保障数据质量
- 提前了解智元机器人的技术路线和产品,展示对公司方向的认同
- 突出大规模数据处理项目经验,尤其是构建高效管道的案例,量化吞吐量和延迟指标
- 强调分布式系统架构设计经验,如使用Spark、Flink等框架搭建数据流水线
- 展示数据质量优化成果,如偏差检测、数据清洗、标注错误修复等具体改进
- 提及多模态或机器人相关项目,体现领域匹配度
- 学习多模态数据处理工具(如MMCV、TorchData)和大模型训练框架(如PyTorch、DeepSpeed)
- 补充机器人交互场景知识,了解语音、视觉、动作数据的采集与标注规范
面试指南
- 对于系统设计类问题,先明确需求(数据量、模态、实时性),然后分模块描述采集、清洗、存储、标注等步骤,最后讨论扩展性与容错
- 对于质量类问题,用STAR方法:描述具体场景、任务、行动和结果,强调数据质量监控指标(如覆盖率、分布均匀性)
- 如何设计一个支持多模态数据(图像、视频、文本、语音)的分布式处理管道?
- 当发现模型出现幻觉或偏见时,你如何从数据层面定位问题并解决?
- 举例说明你如何检测并修复数据集中的偏差或噪声
- 面对海量数据,你如何平衡数据吞吐量和质量?有哪些优化策略?
- 你了解哪些数据增强技术?如何为机器人交互场景设计数据增强策略?
- 复习大数据技术栈(Spark, Kafka, Flink)和分布式系统原理,准备一个自己主导的相关项目案例
职位点评
69
综合评分
前沿AI机器人公司,技术栈新,薪资有竞争力,但工作强度可能较大,WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿、快速成长,对工作强度有充分准备,且看重行业前景的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活40
使命价值80
薪资福利
70中等
薪资水平在AI行业处于较高位置,但JD未明确具体薪资和福利,存在不确定性,整体补偿性动机满足中等偏上。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
85较高
该职位涉及大模型和多模态前沿技术,能深入参与核心数据基础设施,技术成长空间大,但JD未明确提及晋升路径,发展性动机满足较高。
技术前沿前沿/新兴技术
技术栈大模型、多模态、机器人、分布式系统、数据Pipeline
业务类型profit_center
工作生活
40较低
工作地点为深圳或上海,要求现场办公,未提及弹性工作或远程,生活化动机满足程度有限。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
80较高
人形机器人是高速增长赛道,具有较高社会价值,但JD未明确使命信号,整体意义感动机满足较好。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs