
字节跳动
多模态视频理解大模型算法工程师-视频与边缘
多模态视频理解大模型算法工程师-视频与边缘
发布于 大约 2 小时前普通员工/个人贡献者
北京市
其它
全职员工
仅现场办公
硕士
机器学习工程
Internvl
Post-Training
Qwen-Vl
Rl
多模态
大模型
视频理解
AI 估算 · 30k–60k
字节算法岗薪资水平高,硕士毕业通常30-60k/月,考虑视频大模型方向紧缺,薪酬竞争力强。
职位详情
关于这个职位
该职位负责多模态视频理解大模型的研发与应用,包括长视频理解、Token压缩、视频剪辑Agent等前沿方向
你将与团队一起探索算法创新,优化模型效果,并将成果发表于顶会
适合对AI技术有强烈热情、具备扎实算法功底的研究型工程师
最低要求
获得硕士及以上学位,计算机科学、人工智能、自动化等专业优先
熟练掌握Python/C++,熟悉NLP、CV、多模态中的1-2个领域,熟悉大模型训练、RL算法者优先
熟悉Qwen-VL、InternVL、InternVideo等模型,有基于视频Caption、视频Grounding、视频摘要、视频问答、美学评价、高光检测、动作识别、视频编辑、视频风格化等项目落地经验者加分,能深入解决大模型训练和应用存在的问题
发表过CV/NLP/多模态相关顶会论文(比如CVPR/ICLR/ICCV/PAMI/ACL等)或ACM等竞赛获奖
强烈的技术热爱和好奇心与自主探索能力,优秀的分析和解决问题的能力,和团队一起探索新技术创新和落地
工作职责
探索多模态视频理解大模型技术前沿,长视频理解、Token压缩、影视视频剧本还原、全模态高光理解、流式视频理解、理解和生成统一等技术方向,创新性优化相关算法
全模态大模型(文本、图像、语音)的Post-training算法,同时结合用户消费行为持续优化模型效果,结合LongCoT和RL自主探索学习,探索多模态感知能力的边界
探索视频剪辑Agent相关的研发和应用,研究高质量数据的挖掘和合成、大模型的对齐效率、多目标融合的学习,Agent全链路优化的方法等等
探索直播流式场景比如体育、游戏等实时解说,解决工业级效率和效果难题,支持多语言服务全球化
发表相关技术创新成果,比如顶会论文、专利或比赛
AI 洞察
优缺点分析
优点
- 公司平台大,资源丰富,算法团队技术领先
- 研究方向前沿,有机会发表顶会论文和专利
- 薪资水平高,福利完善,职业发展路径清晰
- 能接触大规模业务数据,提升实际应用能力
- 工作强度大,互联网大厂节奏快,可能有加班
- 竞争激烈,团队内外部优秀人才多
缺点 / 挑战
- 技术难度高,需要持续学习和探索,压力较大
- 适合对多模态大模型技术有强烈热情、具备扎实研究能力、乐于挑战前沿难题的算法工程师
角色解读
- 可在算法领域深耕,从工程师成长为技术专家或团队负责人
- 多模态大模型是AI核心方向,发展空间大,可向研究科学家方向发展
- 有机会参与顶级会议论文发表,提升学术影响力,或转向产品技术管理
- 探索多模态视频理解大模型前沿技术,如长视频理解、Token压缩、全模态高光理解等方向
- 负责全模态大模型的Post-training算法优化,结合用户消费行为持续改进模型效果
- 研究视频剪辑Agent的研发与应用,包括数据挖掘、对齐效率、多目标融合学习等
- 探索直播流式场景如体育、游戏实时解说,实现多语言服务全球化
- 扎实的编程基础,熟练掌握Python/C++
- 熟悉NLP、CV、多模态中的1-2个领域,了解大模型训练和RL算法
- 熟悉Qwen-VL、InternVL等模型,有视频理解相关项目经验
- 具备顶会论文或竞赛获奖经历,有独立研究和解决问题的能力
申请策略
- 了解字节跳动视频与边缘团队的具体业务方向,在简历中体现匹配度
- 准备好展示你在多模态领域的实际成果,包括代码和案例
- 突出多模态或视频理解相关项目经验,特别是大模型训练和微调
- 强调Python/C++编程能力和工程实现水平
- 如果有顶会论文或竞赛获奖,务必放在显眼位置
- 展示自主探索能力和解决问题的能力,例如参与开源项目或技术博客
- 熟悉Qwen-VL、InternVL等主流多模态模型结构
- 了解RLHF、LongCoT等强化学习技术
面试指南
- 使用STAR法则:描述情境、任务、行动、结果
- 突出个人贡献
- 从原理到实践:先讲理论方法,再结合具体实现和实验结果
- 强调创新性和工程落地:说明你的方案如何平衡效果和效率
- 请介绍你在多模态视频理解方面的项目经验
- 如何设计一个长视频理解模型?关键挑战是什么?
- 你知道Token压缩吗?有哪些常见方法?
- 如何看待RL在多模态大模型中的应用?
职位点评
77
综合评分
字节大厂算法岗,前沿多模态方向,薪资高,技术成长快,但工作强度大,WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合有强烈技术追求、渴望在AI前沿领域成长并愿意接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活50
使命价值70
薪资福利
85较高
职位薪资竞争力强,公司福利完善,补偿性动机能得到较好满足。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
90较高
职位涉及多模态大模型前沿方向,提供顶会论文发表机会,发展性动机高度满足。
技术前沿前沿/新兴技术
技术栈多模态、视频理解、大模型、RL、Post-training、Qwen-VL、InternVL
业务类型ambiguous
工作生活
50较低
职位要求现场办公,未提及弹性工作或远程,大厂节奏可能较快,生活化动机满足度一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
职位推动视频理解技术发展,有一定科技社会价值,但主要面向商业应用,意义感适中。
行业发展高速增长赛道
社会影响中性/一般
创新程度开拓性创新(行业首创)
字节跳动 的其他在招职位
相似职位推荐
Watch Jobs