ByteDance logo
字节跳动
多模态世界模型算法工程师/专家-豆包大模型

多模态世界模型算法工程师/专家-豆包大模型

发布于 大约 3 小时前

普通员工/个人贡献者

北京市
其它
全职员工
仅现场办公
本科
机器学习工程
Aigc
世界模型
多模态
大模型
强化学习
机器学习
计算机视觉

AI 估算 · 35k–65k

字节大厂算法岗薪资竞争力强,专家级可达更高。

职位详情

关于这个职位

该职位负责研究和开发多模态世界模型,探索多模态理解、生成、强化学习等前沿技术,构建大规模基础模型

你将参与数据建设、模型优化、多模态Agent等核心工作,推动AI技术前沿应用
适合在计算机视觉、深度学习和多模态领域有深厚积累的研究型工程师

最低要求

本科及以上学历,计算机、电子、数学等相关专业

在计算机视觉、多模态、AIGC、机器学习、渲染生成等一个或多个领域有较深入的研究者
具有出色的分析、解决问题的能力,能深入解决大模型训练、应用存在的问题,有自主探索解决方案的能力者
具有良好的沟通协作能力,工作积极主动,能够与团队融洽合作,一起探索新技术,推进技术进步

工作职责

探索研究多模态理解、生成式、机器学习、强化学习、AIGC、计算机视觉、人工智能等前沿技术

探索大规模/超大规模多模态理解与生成交织的基础模型,并进行极致系统优化
数据建设、指令微调、偏好对齐、模型优化
提升数据合成、Scalable Oversight、模型推理、规划能力,构建全面客观准确的评测体系,探索提升大模型能力
探索突破包括而不限于多模态RAG,视觉CoT与Agent等在内的多模态模型、世界模型进阶能力,构建GUI/游戏等虚拟世界的通用多模态Agent
利用预训练、仿真等技术对虚拟/现实世界的各类环境进行建模,提供多模态交互探索的基本能力,推动应用落地,研发以人工智能技术为核心的新技术、新产品

优先资格

具有优秀的基础算法、扎实的机器学习基础,熟悉CV、AIGC、NLP、RL、ML等领域的技术,在CVPR、ECCV、ICCV、NeurIPS、ICLR、SIGGRAPH或SIGGRAPH Asia等顶级会议/期刊上发表论文者优先

具有优秀的代码能力,熟练掌握C/C++或Python编程语言,ACM/ICPC、NOI/IOl、Top Coder、Kaggle等比赛获奖者优先
在多模态、大模型、基础模型、世界模型、RL、渲染生成领域,主导过大影响力项目者优先

AI 洞察

优缺点分析

优点

  • 字节跳动大平台,资源丰富,算法落地场景多
  • 团队是顶级AI研究团队,技术前沿,与顶尖人才共事
  • 薪资待遇有竞争力,有丰厚的年终奖和期权
  • 研究难度大,需要持续跟踪前沿文献并不断创新
  • 竞争激烈,团队内部和外部都面临顶尖人才的竞争
  • 适合热爱人工智能研究、有较强技术好奇心、能承受高强度工作并追求技术极致的人

缺点 / 挑战

  • 研究自由度较高,能探索世界模型等前沿方向
  • 工作强度可能较高,大模型训练需要长时间投入

角色解读

  • 从工程师成长为领域专家,深入多模态底层技术研究
  • 有机会带领技术团队,主导顶级AI研究项目
  • 可转向产品化方向,将研究成果落地为大规模应用
  • 研究并开发多模态世界模型,探索多模态理解与生成的基础模型架构
  • 进行大规模模型训练与优化,包括数据建设、指令微调、偏好对齐等
  • 构建多模态Agent,应用于虚拟世界如GUI、游戏等场景
  • 利用预训练和仿真技术建模虚拟/现实环境,推动AI技术落地
  • 扎实的机器学习基础和深度学习知识,熟悉Transformer等模型结构
  • 掌握Python或C++,能进行高效算法实现和调优
  • 熟悉至少一个领域:计算机视觉、NLP、语音、强化学习等
  • 具备优秀的分析问题和解决问题的能力,能独立探索技术方案

申请策略

  • 了解字节Seed团队研究方向,可以在简历中表达对团队技术的兴趣
  • 提前准备相关项目代码,便于面试时展示
  • 突出在计算机视觉、多模态或大模型方面的研究经历,包括发表的论文
  • 展示相关项目实践,如参与过的开源项目、竞赛获奖等
  • 强调编程能力,尤其是Python/C++的熟练程度,以及代码质量
  • 如果有强化学习或世界模型相关经验,务必突出
  • 系统复习深度学习基础,熟悉主流模型(如Transformer、diffusion)的原理和实现
  • 学习多模态模型的最新进展,如CLIP、Flamingo等

面试指南

  • 采用STAR法则,清晰有序地说明项目背景、任务、行动和结果
  • 结合理论知识和实际案例,展示思考和解决过程
  • 对未知问题,先理清问题定义,再提出假设,最后给出验证方案
  • 请介绍你多模态模型相关的研究或项目经验
  • 如何设计一个训练数据构建方案来提升多模态模型效果?
  • 谈谈你对世界模型的理解,以及如何实现一个简单的世界模型?
  • 在大模型训练中,如何解决数据质量、收敛慢等问题?
  • 你用过哪些多模态模型?它们各自有什么优缺点?

职位点评

77
综合评分

前沿AI研究,高薪但WLB不确定,适合技术驱动者。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长、热衷前沿研究、愿意投入高挑战工作且对WLB要求不苛刻的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值85

薪资福利

80较高

虽然薪资未在JD中明确,但字节大厂算法岗市场回报通常较高,且公司福利体系完善,能满足大部分补偿性需求。

薪资信号未披露(AI估算:35K-65K/月)

成长发展

90较高

岗位处于AI前沿技术领域,涉及多模态、世界模型等先进方向,提供极佳的技术成长和职业发展机会。

技术前沿前沿/新兴技术
技术栈多模态、世界模型、大模型、强化学习、AIGC、计算机视觉、Transformer
业务类型ambiguous

工作生活

50较低

职位要求现场办公,未提供远程或弹性工作信息,大模型研究可能存在较强的工作强度,整体WLB存在不确定性。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

85较高

团队致力于寻找通用智能的新方法,追求智能上限,并明确表示‘为科技和社会发展作出贡献’,使命感强。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号为科技和社会发展作出贡献
创新程度开拓性创新(行业首创)
Watch Jobs