AgiBot logo
智元机器人
优才-多模态交互大模型研究员

优才-多模态交互大模型研究员

发布于 1 天前

普通员工/个人贡献者

深圳市 / 上海市
高级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Pytorch
Vla
Vlm
人机交互
多模态大模型
机器人
深度学习
生成式Ai
跨模态对齐

AI 估算 · 35k–55k

多模态大模型研究员属前沿AI岗位,深圳/上海薪资较高,B轮机器人公司有竞争力,硕士+经验月薪可达35k-55k。

职位详情

关于这个职位

该职位专注于为机器人交互场景研发端到端的多模态大模型,涉及语音、文本、图像、传感器等多模态数据的融合理解与生成

你将探索前沿的VLM/VLA等技术,攻克人机交互中的上下文理解、意图识别、情感感知等关键问题,推动人形机器人的智能化发展
适合对多模态AI和机器人有热情的研究型人才

最低要求

硕士及以上学历,计算机、人工智能、电子、数学等相关专业

出色的问题分析和解决能力,自主探索新解决方案的能力强
关注生成式 AI 和多模态交互技术,对推动人形机器人智能化有热情
熟悉 VLM / VLA / VLP / MLM等多模态任务建模、具备跨模态模型设计与训练经验
理解多模态对齐(如 cross-attention、token-level alignment)、条件生成、多模态融合机制

工作职责

设计、构建、训练和优化面向机器人交互场景的端到端多模态大模型架构

探索和实现模型对多模态输入(语音、文本、图像/视频、深度信息、传感器数据、环境上下文等)的深度融合与理解
研发模型生成多模态输出(语言语音、情绪、表情、移动、行为动作等)的能力,确保输出的一致性与自然性
重点攻克人机交互闭环中的关键问题:上下文记忆与理解、意图识别与澄清、个性化交互、情感感知与表达、长时程对话一致性、任务导向交互等

优先资格

有端到端多模态大模型研究经验,或实际落地应用项目经验者

在 CVPR、NeurIPS、ICLR、ACL 等会议发表多模态相关工作者优先
具有优秀的代码能力和竞赛精神,ACM/ICPC、RoboMaster等比赛获奖者

AI 洞察

优缺点分析

优点

  • 处于AI与机器人交叉前沿领域,技术壁垒高,职业发展空间大
  • 公司B轮阶段,有机会参与核心模型从0到1的研发,个人影响力显著
  • 多模态与生成式AI是当前热门方向,人才稀缺,薪资待遇优厚
  • 端到端多模态模型训练对计算资源和数据要求高,实验周期长
  • 人机交互场景复杂,需要持续解决上下文一致性和个性化等难题
  • 竞争激烈,需要不断跟进最新论文和开源成果,保持技术敏感度

缺点 / 挑战

  • 适合对多模态AI和机器人抱有极大热情,具备较强独立研究能力,喜欢挑战前沿技术难题的硕士或博士

角色解读

  • 从研究员到技术专家,主导多模态模型架构设计与创新
  • 可向技术经理或首席科学家方向发展,带领团队攻克机器人AI难题
  • 积累端到端机器人交互经验,未来可切入通用人工智能或具身智能领域
  • 设计并训练多模态大模型,融合语音、图像、文本等数据,实现机器人的感知与理解
  • 优化模型生成能力,让机器人能够通过语言、动作、表情等方式自然交互
  • 攻克人机交互中的核心难题,如长时程对话一致性、情感感知和意图识别
  • 扎实的深度学习基础,熟悉Transformer、多模态对齐算法(如cross-attention)
  • 掌握VLM/VLA等主流多模态框架,具备端到端模型训练与调优经验
  • 出色的工程能力,熟练使用PyTorch等框架,能快速迭代实验

申请策略

  • 面试前深入了解智元机器人产品方向,思考多模态模型如何提升其机器人交互体验
  • 准备1-2个你攻克过多模态对齐或生成困难的技术故事,用STAR法则展示
  • 重点展示多模态相关项目经验,特别是端到端模型落地或论文成果
  • 突出你对VLM/VLA等技术的深入理解,如有对比实验或改进细节更佳
  • 如有ACM等竞赛获奖或开源贡献,务必提及以证明工程能力
  • 补充端到端多模态训练经验,可通过复现经典模型(如LLaVA、Flamingo)来强化
  • 学习机器人交互相关概念(如人机对话、SLAM)有助于理解应用场景

面试指南

  • 从问题定义、现有方法、你的方案、实验结果四个层次循序渐进
  • 先阐明挑战本质,再提出多种解决思路并对比优劣,最后给出你的选择逻辑
  • 结合具体案例,量化改进效果(如延迟降低、准确率提升),体现工程思维
  • 请详细介绍一下你之前参与的多模态模型项目,架构设计和训练难点?
  • 如何处理多模态输入中的模态缺失或不对齐问题?
  • 在长时程对话中如何保持上下文一致性?
  • 对于机器人实时交互场景,大模型推理速度如何优化?
  • 熟悉最新多模态大模型论文(如LLaVA、Qwen-VL、CogVLM等),并阅读代码

职位点评

77
综合评分

前沿多模态大模型研究员,极高技术成长性,薪资优厚,但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和前沿创新的求职者,若对WLB有较高要求需谨慎考虑。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活50
使命价值85

薪资福利

75中等

该职位薪资水平较高(月薪35k-55k),B轮公司有一定期权可能,但未明确提及福利,整体补偿性一般偏上。

薪资信号未披露(AI估算:35K-55K/月)

成长发展

95较高

职位聚焦前沿多模态大模型技术,鼓励创新和探索,导师制和晋升未明确提及,但技术前沿性和研究自由度极高,发展性极强。

技术前沿前沿/新兴技术
技术栈多模态大模型、VLM、VLA、生成式AI、端到端模型、Transformer
业务类型profit_center

工作生活

50较低

工作地点在深圳或上海,均为一线城市,通勤成本较高。JD未提及远程或弹性办公,机器人研发可能需要密集实验,生活化程度一般。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

人形机器人智能化具有强烈社会意义和技术价值,行业处于高速增长期,职位直接推动该领域发展,意义感强。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号推动人形机器人智能化
创新程度积极采用新技术
Watch Jobs