
智元机器人
多模态交互大模型研究员/专家
多模态交互大模型研究员/专家
发布于 大约 9 小时前普通员工/个人贡献者
上海市 / 深圳市
专家级经验
全职员工
仅现场办公
本科
研究与开发 (研发)
Vla
Vlm
Vlp
人机交互
多模态大模型
深度学习
生成式Ai
自然语言处理
计算机视觉
AI 估算 · 40k–60k
多模态大模型专家属于前沿技术岗位,B轮机器人创业公司为吸引高端人才,薪资竞争力强,参考一线城市AI研究员水平。
职位详情
关于这个职位
该职位专注于设计、构建和优化面向人形机器人交互场景的端到端多模态大模型
你将探索语音、文本、图像、深度信息等多模态输入的深度融合,研发模型生成语言、动作等输出的能力,并攻克上下文记忆、意图识别、个性化交互等关键问题
适合对生成式AI和多模态技术有深厚积累,并希望将前沿技术应用于机器人领域的研究型人才
最低要求
本科及以上学历,计算机、人工智能、电子、数学等相关专业
出色的问题分析和解决能力,自主探索新解决方案的能力强;
关注生成式 AI 和多模态交互技术,对推动人形机器人智能化有热情;
熟悉 VLM / VLA / VLP / MLM等多模态任务建模、具备跨模态模型设计与训练经验
理解多模态对齐(如 cross-attention、token-level alignment)、条件生成、多模态融合机制
工作职责
设计、构建、训练和优化面向机器人交互场景的端到端多模态大模型架构
探索和实现模型对多模态输入(语音、文本、图像/视频、深度信息、传感器数据、环境上下文等) 的深度融合与理解
研发模型生成多模态输出(语言语音、情绪、表情、移动、行为动作等) 的能力,确保输出的一致性与自然性
重点攻克人机交互闭环中的关键问题:上下文记忆与理解、意图识别与澄清、个性化交互、情感感知与表达、长时程对话一致性、任务导向交互等
优先资格
有端到端多模态大模型研究经验,或实际落地应用项目经验者
在 CVPR、NeurIPS、ICLR、ACL 等会议发表多模态相关工作者优先
具有优秀的代码能力和竞赛精神,ACM/ICPC、RoboMaster等比赛获奖者
AI 洞察
优缺点分析
优点
- 处于 AI 和机器人交叉的最前沿,技术栈领先,积累的经验极具市场价值
- 所在公司是人形机器人热门赛道的代表,能参与从 0 到 1 的产品定义和技术突破
- 工作内容涉及多个模态和多学科,学习成长空间大,易产出高水平论文和专利
- 技术难度高,多模态融合和端到端训练仍存在许多未解难题,需要较强的科研能力
- 跨团队协作复杂,需要与硬件、嵌入式、产品等多方沟通,对沟通能力有要求
缺点 / 挑战
- 创业公司节奏快,可能需要同时承担研究和工程落地任务,工作压力较大
- 适合对生成式 AI 和多模态技术有强烈热情,喜欢挑战前沿难题,同时愿意将研究成果落地到真实机器人场景的研究型人才
角色解读
- 在技术纵深上,可从多模态模型研究员发展为视觉-语言-动作领域专家,主导新一代交互架构设计
- 横向可向机器人全栈算法发展,结合感知、规划、控制等方向,成长为机器人算法总负责人
- 管理路径上,可带领多模态算法团队,晋升为技术总监或首席科学家
- 设计并训练端到端的多模态大模型,融合语音、文本、图像、传感器等多源数据,用于机器人交互决策
- 研发模型的多模态输出能力,包括语言、情绪、表情和动作生成,确保在交互中的一致性和自然性
- 攻克人机交互中的关键技术难点,如上下文记忆、意图识别、个性化交互和情感感知
- 与机器人硬件和其他算法团队协作,将模型集成到实际机器人系统中并进行迭代优化
- 扎实的多模态大模型理论基础,熟悉 VLM、VLA、VLP、MLM 等架构和训练范式
- 精通跨模态对齐技术(cross-attention、token-level alignment)和多模态融合机制
- 优秀的编程能力(Python、PyTorch/TensorFlow),有大规模模型训练经验
- 良好的问题分析和探索能力,能独立设计实验并推动技术突破
申请策略
- 准备一份技术演示(如 GitHub 项目或博客),展示你对该领域的深入理解和动手能力
- 面试前了解智元机器人的技术路线和产品定位,思考你的研究如何与其机器人交互场景结合
- 突出多模态相关项目经验,尤其是端到端模型设计、训练和优化经历
- 强调发表的顶会论文(CVPR、NeurIPS、ICLR、ACL 等)或竞赛奖项(ACM/ICPC、RoboMaster)
- 展示在跨模态对齐、条件生成、多模态融合等方面的具体技术细节和成果
- 如果有机器人相关交互系统的落地经验,务必详细描述
- 补充 VLM/VLA 的最新技术动态,如 LLaVA、PaLM-E、RT-2 等模型的原理和实现
- 熟悉强化学习和模仿学习在机器人中的应用,可作为多模态模型的补充技能
面试指南
- 对于项目类问题,采用 STAR 法则(情境、任务、行动、结果),重点突出技术细节和你的贡献
- 对于技术对比问题,先明确各技术的原理,再结合实际场景分析优劣,最后给出选择建议
- 对于开放设计问题,从目标出发,分模块阐述思路(输入处理、模型架构、训练策略、评估方法),展示系统化思考能力
- 请详细描述你参与过的多模态大模型项目,包括架构设计、训练策略和遇到的主要挑战
- 如何实现语音和视觉特征的深度融合?请对比 cross-attention 和 token-level alignment 的优缺点
- 在多模态生成中,如何保证输出的一致性(如动作与语言匹配)?
- 人机交互中的长时程对话一致性如何建模?请给出你的技术方案
- 如果让你设计一个端到端的交互大模型,你会选择哪些输入模态,如何平衡效果和计算效率?
职位点评
74
综合评分
前沿多模态大模型研究岗,技术成长性极高,但需现场办公,创业节奏较快。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
非常适合追求技术成长、热爱前沿挑战、对加班有一定承受能力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展95
工作生活40
使命价值80
薪资福利
75中等
职位未明确薪资但属于前沿技术岗,创业公司为吸引人才通常提供有竞争力的薪酬和期权,但稳定性一般。
薪资信号未披露(AI估算:40K-60K/月)
成长发展
95较高
多模态大模型是当前 AI 最前沿方向,公司专注人形机器人,技术挑战大,个人技能提升空间极大。
技术前沿前沿/新兴技术
技术栈多模态大模型、VLM、VLA、VLP、跨模态对齐、生成式AI、深度学习
业务类型ambiguous
工作生活
40较低
工作地点为上海/深圳/北京,需要现场办公,创业公司节奏快,WLB 可能一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
人形机器人属于高速增长赛道,多模态交互技术对推动机器人智能化有直接社会价值,创新性强。
行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs