Bilibili logo
哔哩哔哩
多模态数据智能工程师【2027届】

多模态数据智能工程师【2027届】

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Qwen-Vl
多模态
数据管道
数据质量
数据飞轮
Gemma

AI 估算 · 15k–25k

上海互联网大厂技术岗,多模态前沿方向,校招薪资有竞争力,一般15薪左右。

职位详情

关于这个职位

这是哔哩哔哩面向2027届毕业生的校招岗位,负责构建多模态数据理解系统,处理海量文本、图片、音频和视频数据

你将参与数据质量优化、数据飞轮和自动化管道建设,与模型团队紧密合作,直接影响大模型训练效果
适合对数据敏感、熟悉Spark/Ray等大数据框架,并希望深入AI数据方向的应届生

最低要求

届本科及以上学历,熟悉 Qwen-VL、Gemma、Gemini 等多模态模型

有 PB 级数据处理经验(Spark/Ray/Flink 等)
有训练数据分析、数据飞轮或推荐系统经验
我们希望你对数据内容保持敏感,有能力从海量数据中发现规律,而不仅仅完成 Pipeline
喜欢从数据出发解释模型问题,并主动推动实验验证
High Agency,能够独立发现问题、定义问题并推动落地

工作职责

构建面向文本、图片、音频、视频的多模态数据理解系统,包括 embedding、retrieval、clustering、classification、tagging 等能力

分析海量数据分布、多样性、冗余、缺失及长尾问题,持续优化训练数据质量
设计高效的数据去重、聚类、召回、采样和数据配比策略,服务于预训练、SFT、RL 等数据生产
与模型团队共同完成数据实验,持续分析数据对模型能力的影响,形成自动化数据飞轮
推动数据分析平台、可视化工具和自动化数据 Pipeline 建设,提高整体数据生产效率

AI 洞察

优缺点分析

优点

  • 哔哩哔哩是知名互联网平台,技术氛围浓厚,能接触真实大规模数据和业务场景
  • 多模态是AI前沿方向,技术迭代快,个人成长空间大,简历含金量高
  • 工作内容与核心模型训练紧密相关,对业务影响力直接,成就感强
  • 上市公司,薪资福利体系完善,稳定性有保障
  • 处理PB级数据,需要较强的工程能力和耐心,可能面临较大的工作强度
  • 多模态技术更新迅速,需要持续学习新模型和框架,保持知识更新
  • 跨团队协作频繁,需要良好的沟通能力和业务理解力,否则容易陷入低效
  • 适合对数据敏感、热爱解决复杂数据问题、希望深入AI数据方向的应届生

缺点 / 挑战

暂无明显挑战项

角色解读

  • 在数据智能方向深耕,成为多模态数据处理专家或大数据架构师
  • 向算法工程师转型,从事模型训练和优化,尤其是多模态模型相关方向
  • 向技术管理发展,领导数据团队,负责更大规模的数据基础设施
  • 构建多模态数据理解系统,包括embedding、retrieval、clustering、classification、tagging等能力,覆盖文本、图片、音频和视频
  • 分析海量数据的分布、多样性、冗余和长尾问题,持续优化训练数据质量
  • 设计数据去重、聚类、召回、采样和配比策略,服务于预训练、SFT、RL等数据生产环节
  • 与模型团队协作完成数据实验,推动自动化数据飞轮和数据处理平台建设
  • 熟悉多模态模型(如Qwen-VL、Gemma、Gemini),了解其原理和应用场景
  • 具备PB级数据处理经验,掌握Spark、Ray、Flink等大数据框架
  • 有较强的数据分析能力,能从海量数据中挖掘规律,并基于数据解释模型问题
  • 具备High Agency,能主动发现、定义和推进问题解决

申请策略

  • 在面试前了解B站的内容生态和数据特点,思考多模态数据可能面临的独特挑战
  • 准备一个完整的数据处理项目案例,展示从数据发现问题到解决方案的全链路
  • 突出实习或项目中PB级数据处理经验,详细描述使用的技术栈(如Spark、Ray)和解决的问题
  • 展示对多模态模型的理解,例如使用Qwen-VL或Gemma进行过数据处理或fine-tune
  • 强调数据分析能力,举例说明如何通过数据挖掘发现规律并影响模型效果
  • 体现主动性和推动力,如独立设计过数据管道或优化过数据质量
  • 补充Spark、Ray、Flink等大数据框架的实战经验,可以尝试在项目中应用
  • 学习多模态模型的基本原理,熟悉开源模型如Qwen-VL、Gemma的使用方式

面试指南

  • 问题导向:先明确目标,再讨论方法,最后验证效果
  • 使用STAR法则:结合具体项目案例,说明情境、任务、行动和结果
  • 强调团队协作:展示与模型团队合作的经验,突出数据与模型的闭环迭代
  • 如何设计数据去重算法来处理PB级多模态数据?
  • 多模态数据中,如何平衡不同模态的采样比例?
  • 如果模型效果下降,你如何排查是数据问题还是模型问题?
  • 描述一次你通过数据分析发现数据质量问题的经历
  • 你如何评估数据多样性对模型效果的影响?

职位点评

73
综合评分

上海大厂,多模态前沿方向,技术成长快,薪资有竞争力,但WLB未明确。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
最适合追求技术成长和数据挑战的应届生,对生活平衡要求高的人需谨慎。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值60

薪资福利

75中等

该职位提供有竞争力的薪资和稳定的平台,福利完善,能满足补偿性动机。

薪资信号未披露(AI估算:15K-25K/月)

成长发展

90较高

多模态是AI前沿领域,接触海量数据和大规模计算,技能成长迅速,发展路径清晰。

技术前沿前沿/新兴技术
技术栈Qwen-VL、Gemma、Gemini、Spark、Ray、Flink
业务类型ambiguous

工作生活

50较低

工作地点在上海,互联网大厂工作强度可能较高,JD未明确WLB,生活平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

60中等

该职位参与AI基础设施建设,对内容生态有积极影响,但直接社会价值有限。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs