
哔哩哔哩
多模态数据智能工程师【2027届】
多模态数据智能工程师【2027届】
发布于 大约 14 小时前普通员工/个人贡献者
上海市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Qwen-Vl
多模态
数据管道
数据质量
数据飞轮
Gemma
AI 估算 · 15k–25k
上海互联网大厂技术岗,多模态前沿方向,校招薪资有竞争力,一般15薪左右。
职位详情
关于这个职位
这是哔哩哔哩面向2027届毕业生的校招岗位,负责构建多模态数据理解系统,处理海量文本、图片、音频和视频数据
你将参与数据质量优化、数据飞轮和自动化管道建设,与模型团队紧密合作,直接影响大模型训练效果
适合对数据敏感、熟悉Spark/Ray等大数据框架,并希望深入AI数据方向的应届生
最低要求
届本科及以上学历,熟悉 Qwen-VL、Gemma、Gemini 等多模态模型
有 PB 级数据处理经验(Spark/Ray/Flink 等)
有训练数据分析、数据飞轮或推荐系统经验
我们希望你对数据内容保持敏感,有能力从海量数据中发现规律,而不仅仅完成 Pipeline
喜欢从数据出发解释模型问题,并主动推动实验验证
High Agency,能够独立发现问题、定义问题并推动落地
工作职责
构建面向文本、图片、音频、视频的多模态数据理解系统,包括 embedding、retrieval、clustering、classification、tagging 等能力
分析海量数据分布、多样性、冗余、缺失及长尾问题,持续优化训练数据质量
设计高效的数据去重、聚类、召回、采样和数据配比策略,服务于预训练、SFT、RL 等数据生产
与模型团队共同完成数据实验,持续分析数据对模型能力的影响,形成自动化数据飞轮
推动数据分析平台、可视化工具和自动化数据 Pipeline 建设,提高整体数据生产效率
AI 洞察
优缺点分析
优点
- 哔哩哔哩是知名互联网平台,技术氛围浓厚,能接触真实大规模数据和业务场景
- 多模态是AI前沿方向,技术迭代快,个人成长空间大,简历含金量高
- 工作内容与核心模型训练紧密相关,对业务影响力直接,成就感强
- 上市公司,薪资福利体系完善,稳定性有保障
- 处理PB级数据,需要较强的工程能力和耐心,可能面临较大的工作强度
- 多模态技术更新迅速,需要持续学习新模型和框架,保持知识更新
- 跨团队协作频繁,需要良好的沟通能力和业务理解力,否则容易陷入低效
- 适合对数据敏感、热爱解决复杂数据问题、希望深入AI数据方向的应届生
缺点 / 挑战
暂无明显挑战项
角色解读
- 在数据智能方向深耕,成为多模态数据处理专家或大数据架构师
- 向算法工程师转型,从事模型训练和优化,尤其是多模态模型相关方向
- 向技术管理发展,领导数据团队,负责更大规模的数据基础设施
- 构建多模态数据理解系统,包括embedding、retrieval、clustering、classification、tagging等能力,覆盖文本、图片、音频和视频
- 分析海量数据的分布、多样性、冗余和长尾问题,持续优化训练数据质量
- 设计数据去重、聚类、召回、采样和配比策略,服务于预训练、SFT、RL等数据生产环节
- 与模型团队协作完成数据实验,推动自动化数据飞轮和数据处理平台建设
- 熟悉多模态模型(如Qwen-VL、Gemma、Gemini),了解其原理和应用场景
- 具备PB级数据处理经验,掌握Spark、Ray、Flink等大数据框架
- 有较强的数据分析能力,能从海量数据中挖掘规律,并基于数据解释模型问题
- 具备High Agency,能主动发现、定义和推进问题解决
申请策略
- 在面试前了解B站的内容生态和数据特点,思考多模态数据可能面临的独特挑战
- 准备一个完整的数据处理项目案例,展示从数据发现问题到解决方案的全链路
- 突出实习或项目中PB级数据处理经验,详细描述使用的技术栈(如Spark、Ray)和解决的问题
- 展示对多模态模型的理解,例如使用Qwen-VL或Gemma进行过数据处理或fine-tune
- 强调数据分析能力,举例说明如何通过数据挖掘发现规律并影响模型效果
- 体现主动性和推动力,如独立设计过数据管道或优化过数据质量
- 补充Spark、Ray、Flink等大数据框架的实战经验,可以尝试在项目中应用
- 学习多模态模型的基本原理,熟悉开源模型如Qwen-VL、Gemma的使用方式
面试指南
- 问题导向:先明确目标,再讨论方法,最后验证效果
- 使用STAR法则:结合具体项目案例,说明情境、任务、行动和结果
- 强调团队协作:展示与模型团队合作的经验,突出数据与模型的闭环迭代
- 如何设计数据去重算法来处理PB级多模态数据?
- 多模态数据中,如何平衡不同模态的采样比例?
- 如果模型效果下降,你如何排查是数据问题还是模型问题?
- 描述一次你通过数据分析发现数据质量问题的经历
- 你如何评估数据多样性对模型效果的影响?
职位点评
73
综合评分
上海大厂,多模态前沿方向,技术成长快,薪资有竞争力,但WLB未明确。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
最适合追求技术成长和数据挑战的应届生,对生活平衡要求高的人需谨慎。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值60
薪资福利
75中等
该职位提供有竞争力的薪资和稳定的平台,福利完善,能满足补偿性动机。
薪资信号未披露(AI估算:15K-25K/月)
成长发展
90较高
多模态是AI前沿领域,接触海量数据和大规模计算,技能成长迅速,发展路径清晰。
技术前沿前沿/新兴技术
技术栈Qwen-VL、Gemma、Gemini、Spark、Ray、Flink
业务类型ambiguous
工作生活
50较低
工作地点在上海,互联网大厂工作强度可能较高,JD未明确WLB,生活平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
该职位参与AI基础设施建设,对内容生态有积极影响,但直接社会价值有限。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs