
字节跳动
多模态内容理解算法专家-抖音直播(深圳/北京)
多模态内容理解算法专家-抖音直播(深圳/北京)
发布于 大约 2 小时前普通员工/个人贡献者
北京市 / 深圳市
专家级经验
全职员工
仅现场办公
本科
机器学习工程
Cnn
Deepspeed
Llm
Megatron
Rl
Vlm
多模态
数据预处理
模型微调
AI 估算 · 50k–80k
抖音直播核心业务,多模态算法专家稀缺,薪资竞争力强,15薪。
职位详情
关于这个职位
负责抖音直播多模态内容理解大模型的研发,包括模型训练、微调、部署,以及多模态数据处理与优化
适合在计算机视觉或多模态领域有深厚研究经验的算法专家,参与核心业务和前沿技术落地
最低要求
本科及以上学历,计算机相关专业
在计算机视觉/多模态某领域有深入的研究或项目经验
熟悉多模态大模型(VLM)、大语言模型(LLM)、RL相关的算法技术,熟悉大模型相关的数据构造方法、Post Training算法,对多模态数据处理具备优秀的独立开发与调试能力
有大规模模型训练、压缩、蒸馏、微调等经验
优秀的分析和解决问题的能力,对解决具有挑战性的问题充满激情,良好的沟通和团队合作能力
工作职责
负责抖音直播实时互动相关的多模态内容理解工作,打造业界领先的多模态内容理解大模型
基于CNN、VLM等技术推进模型训练、微调、评测及高效部署,推动模型在下游业务上的应用,包括并不限于多模态对话、多模态互动内容生成、Caption文本生成等,助力业务规模应用落地
规划实现并优化海量多模态数据的预处理、清洗、标注、特征提取及高效融合方法
优先资格
在顶级学术会议有论文发表者或获得竞赛优胜者优先
熟悉Megatron、Deepspeed等框架者优先
对视觉CoT有研究经验者优先,对类GPT-4o实时对话的多模态流式计算有落地经验者优先
AI 洞察
优缺点分析
优点
- 团队技术积累深厚,接触最前沿的大模型和多模态技术
- 薪酬福利优厚,有良好的人才培养和晋升机制
- 技术难度高,需要持续学习和探索最新算法
- 多模态领域竞争激烈,需要不断有结果产出
缺点 / 挑战
- 抖音直播业务体量大,技术挑战高,项目影响力大
- 业务节奏快,可能面临较高的工作压力和强度
- 适合有深厚算法功底、热爱挑战、希望在大模型领域深耕的研究型人才
角色解读
- 成为多模态领域的技术专家,主导核心算法研发
- 向技术管理方向发展,带领团队落地业务
- 接触前沿大模型技术,有机会发表论文和行业影响力
- 负责抖音直播实时互动中的多模态内容理解,构建大规模多模态模型,提升互动体验
- 基于CNN、VLM等技术进行模型训练、微调与部署,支持多模态对话、内容生成与Caption等业务
- 优化海量多模态数据的预处理、清洗、特征提取与融合,为模型提供高质量数据
- 扎实的计算机视觉/多模态基础,熟悉VLM、LLM、RL等模型技术
- 熟悉大模型训练、微调、压缩、蒸馏,掌握Megatron、Deepspeed等分布式训练框架
- 具备优秀的数据处理能力,能独立开发调试多模态数据流水线
- 有较强的问题分析与解决能力,具备学术研究经验或顶级论文者更佳
申请策略
- 了解抖音直播业务场景,思考多模态技术如何提升用户互动
- 在面试中展示对前沿技术的热情和解决复杂问题的能力
- 突出计算机视觉/多模态相关项目经历,特别是大模型训练和应用经验
- 强调论文发表、竞赛成绩等学术成果,体现研究深度
- 展示数据处理和工程化能力,如数据流水线搭建、分布式训练经验
- 补充对VLM、LLM最新进展的理解,熟悉主流开源模型和框架
- 练习大模型训练部署,掌握Megatron、Deepspeed等并行策略
- 积累多模态数据处理经验,学习特征融合方法
面试指南
- 用STAR法则讲述项目:情境、任务、行动、结果,突出个人角色和量化成果
- 回答技术问题时先阐述原理,再结合业务场景提出解决方案,体现思考深度
- 展现学习热情,提及关注的最新论文或开源项目,表明你走在技术前沿
- 请介绍一个你参与的多模态项目,你在其中的具体贡献和难点是什么?
- 谈谈你对VLM和LLM在视频直播场景中应用的理解?
- 如何在海量多模态数据上高效训练大模型?你会采用哪些优化策略?
- 描述一次你通过算法优化显著提升业务指标的案例
- 你对视觉CoT或实时多模态交互有什么研究或实践?
职位点评
79
综合评分
抖音直播核心算法岗位,薪资高、技术前沿,但工作强度大。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和高薪的算法工程师,能适应高强度工作节奏。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活50
使命价值75
薪资福利
85较高
字节跳动算法专家薪资极具竞争力,且公司福利完善,但JD未详细列出,综合评分偏高。
薪资信号未披露(AI估算:50K-80K/月)
成长发展
95较高
职位处于多模态大模型前沿,技术挑战大,成长机会丰富,但晋升路径未明确说明。
技术前沿前沿/新兴技术
技术栈多模态、VLM、LLM、RL、CNN、模型训练
业务类型profit_center
工作生活
50较低
职位要求到岗工作,未提及弹性或远程,字节跳动工作强度可能较大,办公地点位于市中心或科技园,综合评分中等偏低。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
多模态AI是高速增长赛道,技术有影响力,但主要服务娱乐业务,社会意义一般。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
字节跳动 的其他在招职位
相似职位推荐
Watch Jobs