
智元机器人
具身智能算法研究员
具身智能算法研究员
发布于 大约 10 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
3D Gaussian Splatting
Ppo
Pytorch
Slam
Vla
具身智能
强化学习
机器人学
AI 估算 · 35k–70k
具身智能算法研究员属于AI前沿领域,人才稀缺,但B轮公司薪资略低于大厂,上海地区硕士起薪约35-70K/月。
职位详情
关于这个职位
该职位聚焦于具身智能机器人的核心算法研发,涉及三维感知、机器人学习、多模态大模型等前沿方向
你将负责从环境理解到端到端决策的算法设计与实现,并部署到真实机器人上完成复杂任务
适合在CV、机器人、深度学习领域有深厚积累的研究型人才
最低要求
计算机视觉、机器人学、机器学习、图形学等相关专业硕士及以上学历,博士优先
在以下至少一个方向有深入研究和项目经验:
三维重建/SLAM/3D Gaussian Splatting/物体姿态估计/人体手部重建
模仿学习(BC、ACT、Diffusion Policy)、强化学习(PPO、SAC)、机器人控制(MPC、力控)、VLA架构(RT-2、PaLM-E等)
多模态预训练(CLIP、LLaVA)、大模型微调(LoRA、RLHF)、自动标注、数据合成与数据策略
扎实的编程能力:精通Python,熟悉C++,熟练使用PyTorch/JAX等深度学习框架
熟悉至少一种仿真器(Isaac Sim、Mujoco、PyBullet)或真实机器人平台
具备优秀的学习能力、逻辑思维与跨团队协作精神,能够快速将前沿论文转化为可工作的原型
工作职责
方向一:空间智能与三维重建
研发前馈式(Feedforward)3D Gaussian Splatting 场景重建算法,从稀疏多视角或单目视频毫秒级输出紧凑3D高斯表示,支持动态更新与压缩
构建实时SLAM系统(融合传统/NeRF/3DGS方法),处理自我中心(egocentric)与人中心(exocentric)混合输入,输出机器人坐标系下的稠密几何、物体6DoF位姿及相机轨迹
开发人体-物体交互(HOI)重建:从多视角外部视频重建物体网格+姿态、人体SMPL/手部MANO参数
从单目自我中心视频实时重建手部与接触关系,生成时空对齐的HOI轨迹
设计自动标定与数据预处理管线(多相机外参自标定、时间同步、空间对齐),为下游模型提供规范化输入
向端到端模型输出可消费的空间Token(如场景图序列、可操作实体列表、接触点坐标),并与RL组协同提供动态场景下的状态预测(世界模型)
方向二:VLA端到端模型与RL后训练
设计并训练视觉-语言-动作多模态Transformer(参考RT-2、Octo、PaLM-E),输入自然语言指令 + 空间Token + 本体感觉,输出离散/连续动作Token(关节角度、末端位姿或扩散策略)
优化模型在真机上的推理速度与泛化能力,探索不同动作表示与模型压缩技术
利用仿真环境(Isaac Sim、Mujoco)对VLA模型进行强化学习微调(PPO/SAC/RLPD),解决域迁移导致的分布漂移
设计域随机化、系统辨识、扰动注入策略,提升策略在真实机器人上的成功率与平滑度
方向三:预训练、Omni大模型与数据策略
利用大规模人类视频(Ego4D、Open X-Embodiment)及无本体交互数据,预训练多模态基座模型(视觉-语言-动作联合),作为VLA主干backbone
探索scaling law,设计模型架构(如Transformer、DiT)与预训练任务(MAE、动作预测、对比学习)
基于VLM/VLA大模型构建自动标注管线,对视频、轨迹、触觉信号进行结构化标注(动作阶段、接触事件、成功/失败标签),降低人工成本
设计主动学习策略,从海量数据中筛选高价值样本(失败轨迹、长尾场景)
牵头制定数据混合策略:真机遥操作数据 : 无本体人类视频 : 仿真合成数据的最优比例,设计消融实验验证,建立数据价值评估模型
优先资格
有真实机器人(机械臂、人形、四足)部署经验,特别是高复杂度操作任务(装配、双手协作)
在CVPR/ICCV/ECCV/CoRL/ICRA/RSS/NeurIPS等顶会发表论文,或有高质量开源贡献
处理过Ego4D、HoloAssist或自采机器人混合数据,有Sim2Real迁移实战经验
熟悉ROS/ROS2,有实时系统或嵌入式开发经验
AI 洞察
优缺点分析
优点
- 处于AI前沿赛道——具身智能,技术迭代快,个人成长空间大
- 接触从感知到决策的全栈算法研发,综合能力提升迅速
- 团队技术氛围浓厚,鼓励将前沿论文转化为产品,成就感强
- 领域知识深度要求高,需要同时掌握CV、RL、大模型等多领域技能
- 真机部署环境复杂,调试耗时,需要较强的抗压与问题解决能力
- B轮公司资源有限,可能需要多线程并行推进多个方向
缺点 / 挑战
- 适合对机器人AI有强烈热情、具备科研素养和工程能力的研究型人才,乐于挑战从算法到落地的全流程
角色解读
- 资深算法研究员→技术Leader→首席科学家,在具身智能领域持续深耕
- 横向拓展至机器人全栈(从感知到控制),成为机器人系统架构师
- 积累学术影响力,通过顶会论文和开源项目成为领域专家
- 研发3D场景重建与SLAM算法,将传感器数据转化为机器人可理解的3D表示
- 设计并训练视觉-语言-动作多模态模型,实现自然语言指令到机器人动作的端到端映射
- 利用仿真环境进行强化学习后训练,提升策略在真实场景的鲁棒性
- 构建大规模数据预训练管线,包括自动标注、数据混合与主动学习策略
- 扎实的计算机视觉与机器人学理论基础,精通三维重建、SLAM或3DGS
- 深度学习框架(PyTorch/JAX)熟练,能独立实现Transformer、扩散策略等模型
- 熟悉强化学习(PPO/SAC)及仿真器(Isaac Sim/Mujoco),有Sim2Real经验
- 优秀的编程能力(Python/C++)和工程实践,能快速将论文转化为原型
申请策略
- 在求职信中表达对具身智能的热情,并提及你对该方向的理解与个人贡献
- 提前了解智元机器人的产品与技术路线,面试时主动关联自己的经验
- 突出3D视觉、机器人或强化学习相关项目成果,尤其是论文或开源贡献
- 展示端到端模型训练或Sim2Real迁移的实际经验,用数据说明效果
- 强调编程能力(Python/C++)和工程实现细节,如优化推理速度、部署流程
- 补充ROS/ROS2或实时系统经验,增加工程落地竞争力
- 学习Isaac Sim等仿真工具,动手跑通一个RL训练+Sim2Real的完整案例
面试指南
- 结构化回答:先讲整体思路,再拆解关键模块,最后强调实验验证
- 问题解决导向:结合具体项目,说明遇到的挑战、解决方案与最终效果
- 学术+工程结合:引用前沿论文方法,同时考虑落地的计算资源限制
- 请描述你如何设计一个端到端VLA模型,从输入到输出包括哪些模块?
- D Gaussian Splatting的核心原理是什么?如何将其用于实时SLAM?
- 你如何解决Sim2Real中的域迁移问题?请举例说明
- 在训练强化学习策略时,如何设计奖励函数以完成复杂操作任务?
- 你如何处理大规模混合数据(真机+仿真+人类视频)的训练策略?
职位点评
68
综合评分
前沿具身智能研发岗,技术成长空间极大,但工作强度可能较高,福利待遇未明。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求前沿技术成长、喜欢攻克科研难题的年轻人,对薪资和生活平衡要求不苛刻。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展92
工作生活45
使命价值75
薪资福利
60中等
薪资处于AI行业中等偏上水平,但B轮公司稳定性一般,福利信息未明确披露。
薪资信号未披露(AI估算:35K-70K/月)
成长发展
92较高
职位涉及最前沿的具身智能技术,有大量成长空间,鼓励论文发表与开源。
技术前沿前沿/新兴技术
技术栈3D Gaussian Splatting、VLA、强化学习、多模态预训练、SLAM、扩散策略、NeRF、Isaac Sim
业务类型profit_center
工作生活
45较低
未提及弹性工作,上海办公可能涉及较长通勤,且算法研究员通常加班较多。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
具身智能是推动机器人智能化的关键技术,具有社会价值,但公司处于商业化早期。
行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs