
智元机器人
具身智能算法岗 - 感知模型方向-智鼎子公司
具身智能算法岗 - 感知模型方向-智鼎子公司
发布于 大约 17 小时前普通员工/个人贡献者
上海市
无经验要求
全职员工
仅现场办公
硕士
研究与开发 (研发)
3D视觉
Clip
Pytorch
Sam
位姿估计
深度学习
点云处理
物体检测
计算机视觉
AI 估算 · 20k–35k
B轮公司、具身智能前沿赛道、上海硕士应届,薪资有竞争力,参考头部AI公司算法岗水平
职位详情
关于这个职位
该职位聚焦具身智能机器人的视觉感知算法研发,涉及物体检测、位姿估计、抓取检测等核心任务
你将参与前沿模型复现与改进,构建数据pipeline,并在仿真与真机上完成闭环验证
适合对机器人视觉有强烈热情的应届硕士及以上毕业生,有机会接触业界最新技术并积累算法工程落地经验
最低要求
/2025 届应届毕业生,计算机、人工智能、自动化、机器人、电子工程、数学等相关专业,硕士及以上学历;
扎实的计算机视觉/深度学习基础,熟悉目标检测、语义/实例分割、2D 与 3D 视觉的核心方法;
熟悉位姿估计、Affordance / Grasp 检测中至少一个方向的主流模型与实现,了解其数据处理与训练流程;
熟悉点云处理、多视图几何、RGB-D 成像原理等 3D 视觉基础;
熟练使用 PyTorch,具备良好的工程能力与代码习惯,能独立完成实验设计与结果分析;
对具身智能/机器人感知有强烈热情,学习能力强,具备良好的沟通与团队协作能力
工作职责
参与具身智能感知模型/算法研发,涵盖物体检测与分割、6-DoF 位姿估计、Affordance预测与Grasp检测等核心感知能力;
跟踪并复现业界前沿感知工作(如 FoundationPose / MegaPose、AnyGrasp、Contact-GraspNet、GraspNet、SAM / Grounding DINO 等),面向真机操作场景做算法改进与创新;
构建感知模型的数据 pipeline:RGB-D / 点云数据采集、合成数据(sim-to-real)生成、自动化标注与清洗;
负责模型训练、评测与部署,在仿真与真机上完成闭环验证,为下游抓取/操作任务提供稳定可靠的感知输入;
探索 2D/3D 视觉基础模型(SAM、DINOv2、CLIP)与 3D 表征(点云、3DGS、NeRF)在具身感知中的应用
AI 洞察
优缺点分析
优点
- 具身智能是AI前沿赛道,行业处于高速增长期,未来发展空间大
- 公司B轮阶段,技术投入大,有机会接触真机且参与核心算法闭环
- 团队技术氛围浓厚,能快速积累视觉感知与机器人落地经验
- 技术难度高,需要同时掌握2D/3D视觉、点云处理及机器人相关领域知识
- 算法从仿真到真机部署存在不确定性,调试和迭代周期较长
- 行业竞争激烈,需持续跟踪前沿论文并快速复现改进
缺点 / 挑战
- 适合对机器人视觉有强烈热情、具备扎实CV/深度学习基础、愿意接受高难度挑战的应届硕士或博士
角色解读
- 从感知算法工程师向具身智能全栈(感知+控制+规划)发展,成为机器人系统专家
- 深耕视觉基础模型与3D表征方向,成为具身感知领域的技术专家或研究科学家
- 可向技术管理岗(团队Leader/技术总监)发展,带领算法团队解决复杂机器人任务
- 研发物体检测、分割、位姿估计等具身感知模型,复现并改进FoundationPose、AnyGrasp等前沿工作
- 构建RGB-D/点云数据pipeline,包括数据采集、合成数据生成与自动化标注
- 负责模型训练、评测与真机部署,为下游抓取和操作任务提供可靠的感知输入
- 探索2D/3D基础模型(SAM、CLIP、3DGS)在机器人感知中的应用
- 扎实的计算机视觉和深度学习基础,熟悉目标检测、分割、3D视觉核心方法
- 掌握位姿估计、Affordance/Grasp检测中至少一个方向的主流模型与实现
- 熟练使用PyTorch,具备独立实验设计与结果分析能力
- 熟悉点云处理、多视图几何、RGB-D成像原理等3D视觉知识
申请策略
- 在简历和面试中展现对具身智能的热情,可附上相关技术博客或GitHub项目
- 提前了解智元机器人的技术路线和产品方向,在面试中针对性提问或讨论
- 突出计算机视觉相关项目经历,特别是目标检测、分割、位姿估计或抓取检测方向
- 强调使用PyTorch独立完成模型训练、评测和部署的工程能力
- 如有机器人相关竞赛、开源贡献或实习经历,重点展示
- 补强3D视觉短板,系统学习点云处理、多视图几何和RGB-D视觉
- 熟悉SAM、CLIP等视觉基础模型,并尝试在具身任务上进行小实验
- 学习机器人仿真环境(如Isaac Sim、MuJoCo),了解sim-to-real迁移方法
面试指南
- 面对原理类问题,先阐述核心思想,再对比不同方法的适用场景和局限
- 面对系统设计类问题,从输入输出出发,分模块描述,并说明关键难点及解决方案
- 面对改进类问题,结合文献和自身经验,提出具体思路(如数据增强、网络结构、损失函数等)
- 请解释6-DoF位姿估计的常用方法,并比较其优缺点
- 如何设计一个用于机器人抓取的感知pipeline?数据如何获取和标注?
- 谈谈你对FoundationPose或AnyGrasp的理解,如何改进其性能?
- 如何处理真实场景中的遮挡和光照变化对感知的影响?
- 你了解哪些2D/3D视觉基础模型?它们在具身感知中有什么应用潜力?
职位点评
67
综合评分
B轮具身智能公司,前沿技术栈,薪资未披露,成长性极高但工作节奏未知。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合追求技术前沿和快速成长、愿意接受高强度学习挑战的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展90
工作生活40
使命价值75
薪资福利
55较低
JD中未提及具体薪资和福利,但作为B轮上海AI公司,薪资一般有竞争力,稳定性相对大厂偏低。
薪资信号未披露(AI估算:20K-35K/月)
成长发展
90较高
职位聚焦具身智能前沿技术,涉及最新视觉基础模型和3D表征,成长空间极大。
技术前沿前沿/新兴技术
技术栈具身智能、FoundationPose、AnyGrasp、SAM、CLIP、3DGS、NeRF、点云、PyTorch
业务类型ambiguous
工作生活
40较低
仅现场办公无远程选项,未提及WLB相关信息,上海互联网公司通常节奏较快。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
具身智能是高速增长赛道,对推动机器人智能化有较高社会价值,但JD未明确使命相关表述。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs