Xiaohongshu logo
小红书
多模态基础模型实习生

多模态基础模型实习生

发布于 大约 9 小时前

实习/见习

北京市 / 上海市
无经验要求
实习生
仅现场办公
学历未注明
实习与临时职位
Deepspeed
Internvl
Llava
Megatron-Lm
Mllm
Pytorch
Qwen-Vl
Vlm
分布式训练

AI 估算 · 4k–8k

大厂算法实习生薪资具有竞争力,北京/上海生活成本较高,日薪约200-400元,月薪按22天计算。

职位详情

关于这个职位

该实习岗位属于小红书多模态基础模型团队,专注于构建大模型的视觉与语言核心能力

你将参与VLM的Post-training与架构演进,通过预训练、微调和强化学习优化模型性能,并探索Scaling Law、多模态Agent等前沿方向
工作将深度赋能小红书的搜索、广告、推荐等核心业务场景,适合对多模态和LLM有浓厚兴趣的研究型实习生

最低要求

专业背景:计算机、自动化、数学等相关专业在读,对多模态方向有浓厚兴趣

技术功底:编程基础扎实,精通 Python,熟练掌握 PyTorch 框架,有分布式训练(DeepSpeed/Megatron-LM)经验者大加分
算法理解:熟悉主流 VLM 架构(如 LLaVA, Qwen-VL, InternVL 等)及训练策略,对 Transformer 机制有深度理解
实习要求:能长期实习,至少 4个月 以上,每周出勤 4天 及以上,Base 北京

工作职责

核心模型研发:参与大规模视觉语言模型(VLM/MLLM)的预训练、微调和强化学习,优化模型在多模态理解、推理等任务上的表现

数据闭环构建:探索高质量多模态数据的自动化清洗、标注与构造方案,从源头提升模型性能
前沿技术探索:研究 Scaling Law、长文本/长视频理解、多模态 Agent 等前沿方向,保持团队技术领先性
业务落地支撑:将 VLM 基础能力转化并赋能于小红书复杂的社区场景,解决实际的图文/视频理解难题

优先资格

加分项:在 CVPR、ICCV、NeurIPS、ICLR 等顶会发表过论文者优先

有大规模数据清洗或基础模型训练经验者优先

AI 洞察

优缺点分析

优点

  • 接触最前沿的多模态大模型技术,包括VLM、RLHF等,技能含金量高
  • 小红书独特的图文和视频UGC数据生态,为模型训练提供丰富素材
  • 团队技术氛围浓厚,鼓励创新和论文发表,适合研究型实习生
  • 大厂实习经历对后续求职或深造有显著加分
  • 实习生需承担研究性质的工作,要求较强的自学能力和独立解决问题能力
  • 多模态领域进展迅速,需要持续跟踪最新论文和技术动态
  • 适合对多模态大模型有浓厚兴趣、希望深入参与前沿研究并有较强编程和算法基础的计算机相关专业在读学生

缺点 / 挑战

  • 长期实习(至少4个月)且每周4天以上,对课业安排有一定压力

角色解读

  • 实习期间可积累前沿的大模型训练和部署经验,有机会发表学术论文
  • 可向多模态研究员或算法工程师方向发展,未来成为大模型领域专家
  • 表现优秀者可转正为正式员工,加入小红书AI团队,参与核心产品落地
  • 参与大规模视觉语言模型(VLM)的预训练、微调(SFT)和强化学习(RL),优化模型在多模态理解与推理任务上的表现
  • 构建高质量多模态数据的自动化清洗、标注与构造方案,提升模型训练数据质量
  • 探索Scaling Law、长视频理解、多模态Agent等前沿技术,保持团队技术领先性
  • 将VLM基础能力应用于小红书社区场景,如图文理解、视频理解等,解决实际业务问题
  • 扎实的编程基础,精通Python和PyTorch框架,熟悉分布式训练(DeepSpeed/Megatron-LM)
  • 深入理解主流VLM架构(如LLaVA、Qwen-VL、InternVL)及Transformer机制
  • 具备多模态或NLP/CV领域的研究经验,了解强化学习(RLHF等)
  • 有数据处理经验,能够设计和优化大规模数据清洗流程

申请策略

  • 关注小红书技术博客或开源项目,了解团队研究方向,在面试中展示匹配度
  • 提前准备好一个关于多模态模型的研究或项目案例,能清晰阐述创新点和贡献
  • 突出大规模模型训练或分布式训练经验,如使用DeepSpeed/Megatron-LM
  • 列举参与过的多模态或NLP/CV项目,尤其是VLM相关(如LLaVA、BLIP)
  • 如有顶会论文(CVPR、NeurIPS等)或开源贡献,需重点标注
  • 强调数据处理能力,如数据清洗、构造等经验
  • 深入理解VLM主流架构和训练范式,可阅读LLaVA、Qwen-VL等论文并复现代码
  • 掌握分布式训练工具DeepSpeed和Megatron-LM的基本使用

面试指南

  • 对于项目介绍,采用STAR法则:情景(Situation)、任务(Task)、行动(Action)、结果(Result)
  • 对于技术原理问题,先简述核心概念,然后结合具体模型或公式说明,最后提一下优缺点和最新进展
  • 对于开放性问题(如数据清洗),先给出目标,再分步骤提出方案,并提及评估标准
  • 请介绍一下你参与过的多模态或NLP项目,你在其中承担了什么角色?
  • 解释一下VLM中的视觉编码器和语言模型是如何交互的?
  • 你在分布式训练中遇到过哪些问题?如何解决通信瓶颈或显存不足?
  • 如何设计一个数据清洗流程来提升多模态模型性能?
  • 你对RLHF的理解是什么?在多模态场景下如何应用?

职位点评

57
综合评分

前沿多模态实习,技术成长极高,但需长期现场办公,WLB一般。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
适合高度重视技术成长和前沿研究能力提升、对工作生活平衡要求不高的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利50
成长发展90
工作生活30
使命价值50

薪资福利

50较低

实习生薪资在大厂中处于中上水平,但实习岗位通常稳定性较低,福利较少,整体补偿性动机满足一般。

薪资信号未披露(AI估算:4K-8K/月)

成长发展

90较高

该职位提供前沿技术研究和开发机会,能够快速积累多模态大模型的经验,成长空间极大。

技术前沿前沿/新兴技术
技术栈VLM、MLLM、LLaVA、Qwen-VL、InternVL、DeepSpeed、Megatron-LM、RLHF、Scaling Law、Transformer
业务类型profit_center

工作生活

30较低

实习要求每周至少4天现场办公,且长期实习,对课业和生活灵活性有较大限制。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

50较低

多模态技术有助于推动AI发展,但小红书作为商业公司,社会使命感相对中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs