
智元机器人
优才-具身智能算法研究员(预训练方向)-觅蜂子公司
优才-具身智能算法研究员(预训练方向)-觅蜂子公司
发布于 1 天前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Jax
Pytorch
Vla
数据策略
机器人学
模仿学习
计算机视觉
预训练
AI 估算 · 35k–65k
高级算法研究员,上海B轮中大型企业,预训练方向人才稀缺,薪资竞争力强,预估月薪35-65K。
职位详情
关于这个职位
该职位聚焦于具身智能机器人的预训练算法研究,主要负责构建多模态基座模型(视觉-语言-动作联合),设计预训练任务与模型架构,并开发自动标注和数据混合策略
你将探索scaling law,处理大规模人类视频与机器人数据,推动VLA模型的性能边界
适合在计算机视觉、机器人学或多模态预训练方向有深入积累的研究型人才
最低要求
计算机视觉、机器人学、机器学习、图形学等相关专业硕士及以上学历,博士优先
在以下至少一个方向有深入研究和项目经验:
三维重建/SLAM/3D Gaussian Splatting/物体姿态估计/人体手部重建
模仿学习(BC、ACT、Diffusion Policy)、强化学习(PPO、SAC)、机器人控制(MPC、力控)、VLA架构(RT-2、PaLM-E等)
多模态预训练(CLIP、LLaVA)、大模型微调(LoRA、RLHF)、自动标注、数据合成与数据策略
扎实的编程能力:精通Python,熟悉C++,熟练使用PyTorch/JAX等深度学习框架
熟悉至少一种仿真器(Isaac Sim、Mujoco、PyBullet)或真实机器人平台
具备优秀的学习能力、逻辑思维与跨团队协作精神,能够快速将前沿论文转化为可工作的原型
工作职责
利用大规模人类视频(Ego4D、Open X-Embodiment)及无本体交互数据,预训练多模态基座模型(视觉-语言-动作联合),作为VLA主干backbone
探索scaling law,设计模型架构(如Transformer、DiT)与预训练任务(MAE、动作预测、对比学习)
基于VLM/VLA大模型构建自动标注管线,对视频、轨迹、触觉信号进行结构化标注(动作阶段、接触事件、成功/失败标签),降低人工成本
设计主动学习策略,从海量数据中筛选高价值样本(失败轨迹、长尾场景)
牵头制定数据混合策略:真机遥操作数据 : 无本体人类视频 : 仿真合成数据的最优比例,设计消融实验验证,建立数据价值评估模型
优先资格
有真实机器人(机械臂、人形、四足)部署经验,特别是高复杂度操作任务(装配、双手协作)
在CVPR/ICCV/ECCV/CoRL/ICRA/RSS/NeurIPS等顶会发表论文,或有高质量开源贡献
处理过Ego4D、HoloAssist或自采机器人混合数据,有Sim2Real迁移实战经验
熟悉ROS/ROS2,有实时系统或嵌入式开发经验
AI 洞察
优缺点分析
优点
- 身处具身智能前沿赛道,课题极具创新性和影响力,可接触最先进的VLA大模型技术
- 公司处于B轮融资阶段,发展迅速,有较大成长空间和资源投入
- 工作内容涵盖预训练、数据策略、模型架构等多个高价值方向,技能积累深厚
- 有机会与顶尖学术和工业界人才合作,发表顶会论文或开源项目
- 算法研究难度高,需要不断跟踪最新论文并快速迭代,工作强度较大
- 涉及多模态数据融合和实际机器人部署,工程落地复杂,可能需要处理大量调试
- 竞争激烈,同行多为顶尖高校博士或资深工程师,对个人能力要求极高
缺点 / 挑战
- 适合在计算机视觉、机器人学或多模态预训练方向有深厚积累,对前沿技术充满热情,并愿意接受高强度研究挑战的研究型人才
角色解读
- 从算法研究员成长为具身智能领域的专家,主导预训练模型架构设计
- 有望晋升为技术主管或团队负责人,带领小组推进VLA模型研发
- 可以向更前沿的通用机器人智能方向拓展,成为行业领军人才
- 设计和训练多模态预训练模型,将视觉、语言和动作信号联合学习,作为VLA模型的基础
- 探索scaling law,优化模型架构和预训练任务(如MAE、对比学习),提升模型性能
- 构建自动标注管线,利用VLM/VLA大模型对视频和轨迹数据进行结构化标注,降低人工成本
- 制定数据混合策略,平衡真机数据、人类视频和仿真数据的比例,并通过消融实验验证数据价值
- 扎实的编程能力:精通Python,熟悉C++,熟练使用PyTorch或JAX等深度学习框架
- 深入掌握计算机视觉、机器人学或多模态预训练领域知识,有相关项目经验
- 熟悉强化学习、模仿学习或控制算法,能理解和改进VLA架构
- 具备优秀的学习能力和论文复现能力,能够快速将前沿研究转化为可工作的原型
申请策略
- 在求职信中展示对具身智能领域的深度理解和热情,可附上相关研究笔记或博客
- 提前了解公司旗下的觅蜂子公司的业务方向,突出自己与团队技术的契合点
- 突出在预训练、VLA架构或多模态学习方面的项目经验,最好有相关论文或开源贡献
- 详细描述处理大规模视频或机器人数据的经验,如Ego4D、Open X-Embodiment等
- 展示编程能力,特别是Python和PyTorch/JAX的使用,如果有C++经验也强调
- 若有真实机器人部署或Sim2Real迁移经验,务必单独列出
- 补充强化学习和模仿学习的理论知识,如PPO、SAC、Diffusion Policy等
- 熟悉至少一个仿真器(Isaac Sim、Mujoco)的使用,增强仿真到现实迁移能力
面试指南
- 对于项目经验问题,采用STAR法则:背景-任务-行动-结果,突出技术难点和你的贡献
- 对于开放性问题(如数据混合策略),先阐述理论依据,再结合具体实验设计,最后说明评估指标
- 对于论文理解问题,先简要概述论文核心贡献,然后提出自己的改进想法或结合现有工作的可能性
- 请详细介绍一下你在预训练模型方面的项目,比如模型架构、预训练任务和数据规模
- 你如何设计数据混合策略来平衡真机数据、人类视频和仿真数据?
- 讲讲你对VLA架构(如RT-2、PaLM-E)的理解,以及如何改进?
- 你处理过哪些大规模机器人或视频数据集?如何处理数据不平衡和标注问题?
- 如何将一篇最新的论文转化为可工作的原型?请举例说明
职位点评
67
综合评分
前沿具身智能算法岗,技术成长极佳,薪资有竞争力,但工作强度大且需现场办公。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合以技术成长和前沿探索为核心的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展90
工作生活30
使命价值80
薪资福利
65中等
薪资在行业内属领先水平,但B轮公司稳定性一般,福利未在JD中明确提及,整体补偿性中等偏上。
薪资信号未披露(AI估算:35K-65K/月)
成长发展
90较高
该职位接触具身智能最前沿技术,包括预训练、VLA、数据策略等,成长空间极大,且公司处于快速发展期。
技术前沿前沿/新兴技术
技术栈预训练、VLA、Transformer、大规模数据策略、多模态
成长机会博士优先、将前沿论文转化为可工作的原型
业务类型ambiguous
工作生活
30较低
仅现场办公,未提及弹性工作或WLB,且算法研究岗位通常工作强度大,生活平衡性较差。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
具身智能是高速增长赛道,推动机器人智能化有较高社会价值,但职位描述未强调使命感。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs