ByteDance logo
字节跳动
多模态视频理解大模型算法工程师-视频与边缘

多模态视频理解大模型算法工程师-视频与边缘

发布于 大约 2 小时前

普通员工/个人贡献者

北京市
其它
全职员工
仅现场办公
硕士
机器学习工程
Internvl
Post-Training
Qwen-Vl
Rl
多模态
大模型
视频理解

AI 估算 · 30k–60k

字节算法岗薪资水平高,硕士毕业通常30-60k/月,考虑视频大模型方向紧缺,薪酬竞争力强。

职位详情

关于这个职位

该职位负责多模态视频理解大模型的研发与应用,包括长视频理解、Token压缩、视频剪辑Agent等前沿方向

你将与团队一起探索算法创新,优化模型效果,并将成果发表于顶会
适合对AI技术有强烈热情、具备扎实算法功底的研究型工程师

最低要求

获得硕士及以上学位,计算机科学、人工智能、自动化等专业优先

熟练掌握Python/C++,熟悉NLP、CV、多模态中的1-2个领域,熟悉大模型训练、RL算法者优先
熟悉Qwen-VL、InternVL、InternVideo等模型,有基于视频Caption、视频Grounding、视频摘要、视频问答、美学评价、高光检测、动作识别、视频编辑、视频风格化等项目落地经验者加分,能深入解决大模型训练和应用存在的问题
发表过CV/NLP/多模态相关顶会论文(比如CVPR/ICLR/ICCV/PAMI/ACL等)或ACM等竞赛获奖
强烈的技术热爱和好奇心与自主探索能力,优秀的分析和解决问题的能力,和团队一起探索新技术创新和落地

工作职责

探索多模态视频理解大模型技术前沿,长视频理解、Token压缩、影视视频剧本还原、全模态高光理解、流式视频理解、理解和生成统一等技术方向,创新性优化相关算法

全模态大模型(文本、图像、语音)的Post-training算法,同时结合用户消费行为持续优化模型效果,结合LongCoT和RL自主探索学习,探索多模态感知能力的边界
探索视频剪辑Agent相关的研发和应用,研究高质量数据的挖掘和合成、大模型的对齐效率、多目标融合的学习,Agent全链路优化的方法等等
探索直播流式场景比如体育、游戏等实时解说,解决工业级效率和效果难题,支持多语言服务全球化
发表相关技术创新成果,比如顶会论文、专利或比赛

AI 洞察

优缺点分析

优点

  • 公司平台大,资源丰富,算法团队技术领先
  • 研究方向前沿,有机会发表顶会论文和专利
  • 薪资水平高,福利完善,职业发展路径清晰
  • 能接触大规模业务数据,提升实际应用能力
  • 工作强度大,互联网大厂节奏快,可能有加班
  • 竞争激烈,团队内外部优秀人才多

缺点 / 挑战

  • 技术难度高,需要持续学习和探索,压力较大
  • 适合对多模态大模型技术有强烈热情、具备扎实研究能力、乐于挑战前沿难题的算法工程师

角色解读

  • 可在算法领域深耕,从工程师成长为技术专家或团队负责人
  • 多模态大模型是AI核心方向,发展空间大,可向研究科学家方向发展
  • 有机会参与顶级会议论文发表,提升学术影响力,或转向产品技术管理
  • 探索多模态视频理解大模型前沿技术,如长视频理解、Token压缩、全模态高光理解等方向
  • 负责全模态大模型的Post-training算法优化,结合用户消费行为持续改进模型效果
  • 研究视频剪辑Agent的研发与应用,包括数据挖掘、对齐效率、多目标融合学习等
  • 探索直播流式场景如体育、游戏实时解说,实现多语言服务全球化
  • 扎实的编程基础,熟练掌握Python/C++
  • 熟悉NLP、CV、多模态中的1-2个领域,了解大模型训练和RL算法
  • 熟悉Qwen-VL、InternVL等模型,有视频理解相关项目经验
  • 具备顶会论文或竞赛获奖经历,有独立研究和解决问题的能力

申请策略

  • 了解字节跳动视频与边缘团队的具体业务方向,在简历中体现匹配度
  • 准备好展示你在多模态领域的实际成果,包括代码和案例
  • 突出多模态或视频理解相关项目经验,特别是大模型训练和微调
  • 强调Python/C++编程能力和工程实现水平
  • 如果有顶会论文或竞赛获奖,务必放在显眼位置
  • 展示自主探索能力和解决问题的能力,例如参与开源项目或技术博客
  • 熟悉Qwen-VL、InternVL等主流多模态模型结构
  • 了解RLHF、LongCoT等强化学习技术

面试指南

  • 使用STAR法则:描述情境、任务、行动、结果
  • 突出个人贡献
  • 从原理到实践:先讲理论方法,再结合具体实现和实验结果
  • 强调创新性和工程落地:说明你的方案如何平衡效果和效率
  • 请介绍你在多模态视频理解方面的项目经验
  • 如何设计一个长视频理解模型?关键挑战是什么?
  • 你知道Token压缩吗?有哪些常见方法?
  • 如何看待RL在多模态大模型中的应用?

职位点评

77
综合评分

字节大厂算法岗,前沿多模态方向,薪资高,技术成长快,但工作强度大,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合有强烈技术追求、渴望在AI前沿领域成长并愿意接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活50
使命价值70

薪资福利

85较高

职位薪资竞争力强,公司福利完善,补偿性动机能得到较好满足。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

90较高

职位涉及多模态大模型前沿方向,提供顶会论文发表机会,发展性动机高度满足。

技术前沿前沿/新兴技术
技术栈多模态、视频理解、大模型、RL、Post-training、Qwen-VL、InternVL
业务类型ambiguous

工作生活

50较低

职位要求现场办公,未提及弹性工作或远程,大厂节奏可能较快,生活化动机满足度一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

职位推动视频理解技术发展,有一定科技社会价值,但主要面向商业应用,意义感适中。

行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
Watch Jobs