
智元机器人
多模态交互算法工程师-X-Lab
多模态交互算法工程师-X-Lab
发布于 大约 15 小时前普通员工/个人贡献者
上海市 / 深圳市
中级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Llm
Onnx
Pytorch
Tensorrt
Vlm
多模态
模型压缩
蒸馏
AI 估算 · 20k–40k
多模态算法工程师稀缺,B轮公司有融资支持,薪资在行业中上水平。
职位详情
关于这个职位
该职位负责多模态交互算法的研究与开发,聚焦于训练流水线建设、Teacher-Student蒸馏、模型压缩部署以及交互语义建模
你将参与从模型训练到端侧部署的全链路工作,推动算法在真实设备上的稳定运行
适合对多模态、模型优化和机器人交互感兴趣的算法工程师
最低要求
硕士及以上在读,计算机、人工智能、自动化、电子信息等相关专业优先
熟练掌握 Python,熟悉 PyTorch 或其他深度学习框架
理解深度学习基础(Transformer、Attention、常见 loss 与优化方法)
工作职责
训练流水线建设:搭建与维护多模态模型训练 Pipeline(涵盖数据预处理、实验追踪、Checkpoint 管理与回归评测),支持音视频、状态序列等多模态输入
Teacher-Student 蒸馏:使用大模型/专家模块生成 Richer Labels,设计蒸馏目标、Loss 函数与 Hard-negative 机制,将高价值能力稳定转移至端侧,摆脱对云端的在线依赖
模型压缩与部署优化:负责 PTQ/QAT、量化感知训练、剪枝与 KV/Cache 优化
导出 ONNX/TensorRT 等格式
在真实设备上死磕 Latency、显存、功耗与推理抖动
质量与回归治理:建立可复现机制,系统性归因模型失效(数据、标签、结构或部署问题)
联合团队建设 Hard slices 与回放评测
运行时协同:与系统侧拆分快慢路径,trade-off 端侧性能与业务收益,推动模型从“实验室能跑”跨越到“设备稳跑”
同时需要兼顾交互语义建模与任务定义(如回应对象判断、交互时机、主动策略等)
优先资格
有以下任一经验优先:LLM / 多模态模型训练(SFT / RLHF / LoRA)、语音 / 视觉 / VLM 项目经验、数据构造或训练 pipeline 搭建
有多模态(音频+视觉)项目经验加分
有 teacher-student 蒸馏或模型压缩经验加分
熟悉交互类任务(如对话、agent、语音交互)加分
做过模型对比实验、误差分析或 benchmark 评测加分
AI 洞察
优缺点分析
优点
- 前沿技术栈:涉及多模态、大模型、模型压缩等热门方向,积累稀缺技能
- 实战场景:从训练到部署全链路,接触真实设备优化,经验价值高
- 公司处于快速发展期,B轮融资,有较多成长空间和资源
- 工作强度可能较大,尤其是设备端优化和问题排查阶段
- 对创新和实验要求高,需要系统性归因和快速迭代
缺点 / 挑战
- 技术难度较高,需要同时掌握训练、蒸馏、压缩和部署多方面知识
- 适合对多模态和模型优化有浓厚兴趣、喜欢挑战技术难题的算法工程师,尤其是希望在机器人或边缘 AI 领域深耕的求职者
角色解读
- 技术纵深发展:成为多模态算法专家,主导模型优化与部署
- 横向拓展:向系统架构或产品方向延伸,涉及端侧 AI 全链路
- 管理路线:带团队负责算法模块,参与技术决策
- 搭建和维护多模态模型训练流水线,处理音视频和状态序列数据
- 设计 Teacher-Student 蒸馏方案,将大模型能力转移到端侧模型
- 进行模型压缩(量化、剪枝)并部署到真实设备,优化延迟和功耗
- 定义交互语义和任务策略,如回应时机和主动决策
- 扎实的深度学习基础,熟悉 Transformer、Attention 等架构
- 精通 Python 和 PyTorch,能独立搭建训练 Pipeline
- 有模型压缩(PTQ/QAT、剪枝)或蒸馏经验者优先
- 了解多模态(语音+视觉)或 LLM/VLM 训练技术
申请策略
- 在面试中强调你对端侧部署和实际工程落地的热情,不要仅停留在算法层面
- 了解公司产品(机器人)的应用场景,思考算法如何提升交互体验
- 突出多模态或 LLM 项目经验,说明你在其中的具体贡献(如训练、优化)
- 展示模型压缩或蒸馏的成果,包括量化、剪枝后的性能指标
- 强调 Python/PyTorch 代码能力和工程化能力,如 Pipeline 搭建
- 补充 teacher-student 蒸馏相关知识,动手复现经典论文
- 学习 ONNX/TensorRT 部署流程,了解端侧推理优化技巧
- 熟悉交互任务(如对话、agent)的常见建模方法
面试指南
- 回答技术问题时,先阐述基础原理,再结合自己项目中的具体做法和数据
- 对于开放性问题,使用 STAR 法则(情境-任务-行动-结果)结构化表达
- 如果没有直接经验,可以展示你对类似问题的分析和学习思路
- 请解释 Teacher-Student 蒸馏的原理,以及你如何设计蒸馏 Loss?
- 如何优化一个多模态模型在边缘设备上的推理延迟?
- 你如何处理训练数据中的噪声或分布偏移?
- 描述一次你排查模型性能下降并系统性归因的经历
- 复习 Transformer、Attention 机制和多模态融合的经典论文
职位点评
67
综合评分
前沿多模态算法岗,技术栈新颖,成长性强,但工作强度可能较大且未明确弹性办公。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术成长和前沿探索的求职者,对WLB要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展88
工作生活40
使命价值70
薪资福利
65中等
B轮中大型企业,薪资竞争力中上,但未明确福利和股权,整体补偿性中等。
薪资信号未披露(AI估算:20K-40K/月)
成长发展
88较高
岗位涉及多模态、大模型、模型压缩等前沿技术,成长空间大,但未明确晋升通道。
技术前沿前沿/新兴技术
技术栈多模态、Teacher-Student蒸馏、模型压缩、量化、ONNX、TensorRT、LLM
业务类型profit_center
工作生活
40较低
需要现场办公,未提及弹性工作,且可能存在高强度优化任务,WLB一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
机器人交互属于高速增长赛道,技术前沿,但社会影响中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs