Tencent logo
腾讯
腾讯游戏-多模态大模型数据工程师/专家

腾讯游戏-多模态大模型数据工程师/专家

发布于 大约 14 小时前

普通员工/个人贡献者

上海市
专家级经验
全职员工
仅现场办公
本科
数据工程
多模态大模型
数据处理
数据清洗

AI 估算 · 30k–60k

腾讯大厂,多模态大模型方向热门,数据工程师薪资竞争力强,上海城市溢价,综合估算。

职位详情

关于这个职位

这是腾讯游戏团队的多模态大模型数据工程师岗位,负责对接视频、图片、音频等多模态数据生产需求,打造数据处理Pipeline和存储框架,支撑大模型训练

适合具备扎实计算机基础、熟悉数据处理和分布式框架的工程师,是深入大模型底层数据建设的核心岗位

最低要求

计算机、软件工程、数学、电子信息、自动化等相关专业,本科及以上学历

计算机基础扎实,熟练掌握Java/C++/Python语言中的一种,有服务端系统的开发经验
熟练掌握文本、多模态等非结构化数据处理方法,熟悉数据清洗、特征提取和数据增强等技术
熟悉分布式计算或大数据处理框架,了解Ray、Spark、Hadoop、Flink相关技术栈
聪明好学,有较强的自驱力和学习力,良好的沟通协作能力

工作职责

对接视频/图片/音频等各类多模态模型的数据生产需求,打造业界领先的数据生产引擎,持续提升数据规模、质量与迭代效率,支撑多模态生成模型训练

搭建Data-Centric多模态数据处理Pipeline,覆盖算子开发、跨模态检索、内容理解及质量筛选等关键环节
构建高可用、高吞吐的数据存储和服务框架,持续优化多模态数据的存储以及检索效率

AI 洞察

优缺点分析

优点

  • 岗位涉及数据处理全链路,从数据生产到存储检索,可以积累完整的大数据工程经验
  • 腾讯平台资源雄厚,技术氛围好,能够接触到业界领先的数据处理框架和工具
  • 薪资福利在行业内具有竞争力,职业发展路径清晰
  • 数据工程师岗位往往需要快速响应业务需求,在数据规模大、时效要求高的情况下,工作强度可能较大
  • 适合对数据处理和大模型方向有浓厚兴趣、具备扎实编程基础、乐于解决复杂技术难题并有较强自驱力的工程师

缺点 / 挑战

  • 多模态大模型是当前最热门的AI方向之一,腾讯拥有丰富的业务场景和海量数据,技术挑战大、成长快
  • 多模态数据处理复杂度高,需要掌握多种技术栈,并持续跟进前沿技术,学习压力较大
  • 需要与算法、产品等多个团队协作,沟通成本较高,对个人的跨团队协调能力有要求

角色解读

  • 在数据工程方向深耕,可以发展为数据架构师或技术专家,负责更复杂的数据系统和平台建设
  • 可以横向延伸至大模型训练全链路,成为多模态大模型领域的数据专家,参与核心模型迭代
  • 在腾讯内部有清晰的职业晋升通道,从工程师到高级工程师、专家再到技术管理,发展空间广阔
  • 负责对接多模态模型的数据生产需求,包括视频、图片、音频等,设计并优化数据生产流程,确保数据规模、质量和迭代效率
  • 搭建Data-Centric的数据处理Pipeline,涉及算子开发、跨模态检索、内容理解和质量筛选,支撑模型训练
  • 构建高可用、高吞吐的数据存储和服务框架,优化多模态数据的存储与检索效率,保障数据服务稳定
  • 扎实的计算机基础,熟练掌握Java/C++/Python至少一种,具备服务端系统开发经验
  • 熟悉文本、多模态等非结构化数据处理,掌握数据清洗、特征提取、数据增强等方法
  • 了解分布式计算或大数据处理框架,如Ray、Spark、Hadoop、Flink等,能够构建大规模数据处理流水线
  • 具备良好的自驱力、学习能力和沟通协作能力,能够与算法、工程团队紧密配合

申请策略

  • 了解腾讯游戏或腾讯AI Lab在多模态大模型方面的布局,在面试中展示你对业务和技术的结合思考
  • 准备一些实际项目案例,说明你在数据规模、效率和质量方面做出的具体优化和量化成果
  • 重点突出多模态数据处理、大数据框架(Spark、Flink、Ray等)相关的项目经验,最好有所处理的数据类型和规模等数据指标
  • 展示你在服务端系统开发方面的经验,尤其是高并发、高可用系统设计和优化案例
  • 如果有参与过大模型训练或数据处理Pipeline的构建,一定要详细描述你的角色和贡献
  • 强调自己的学习能力和钻研精神,例如对新技术的研究成果或开源贡献
  • 提前熟悉多模态数据处理的基本流程,如数据清洗、特征提取、数据增强等技术,可以参考业界常用工具
  • 学习并实践Ray、Spark、Flink等分布式计算框架,了解它们在数据处理中的典型应用场景

面试指南

  • 对于项目类问题,采用STAR法则(情境、任务、行动、结果),突出个人贡献和量化成果
  • 对于系统设计类问题,先明确需求(数据规模、吞吐、延迟),再给出架构选型和关键组件,最后说明容错和扩展性
  • 对于技术概念对比类问题,从原理、特点、适用场景三个维度分析,并结合实际经验
  • 请介绍你做过的一个多模态数据处理项目,其中遇到了哪些挑战,你是如何解决的?
  • 如何设计一个高吞吐、高可用的多模态数据存储和检索框架?
  • 谈谈你对Data-Centric AI的理解,以及如何提升数据质量来改善模型效果?
  • 你熟悉哪些分布式计算框架?请比较Ray、Spark和Flink的适用场景
  • 在大规模数据清洗中,如何保证处理效率和数据质量?

职位点评

74
综合评分

腾讯大厂、前沿多模态数据工程方向,技术成长空间大,薪资有竞争力但工作强度和WLB未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长、渴望在大模型数据领域深耕的求职者,对工作生活平衡要求较高者需谨慎。
表现最好
成长发展
相对薄弱
工作生活
薪资福利72
成长发展88
工作生活55
使命价值80

薪资福利

72中等

腾讯作为头部大厂,薪资福利具有市场竞争力,但具体薪资未披露,且上海生活成本较高,综合来看补偿性中等偏上。

薪资信号未披露(AI估算:30K-60K/月)

成长发展

88较高

多模态大模型是前沿技术方向,岗位涉及数据工程全链路,技术成长空间大,能够接触到业界领先的框架和工具,发展性很强。

技术前沿前沿/新兴技术
技术栈多模态、数据处理、Java、C++、Python、Ray、Spark、Hadoop、Flink、数据清洗、特征提取、数据增强
业务类型profit_center

工作生活

55较低

工作地点在上海,但JD未提及远程或弹性办公,只能按现场办公处理,且大厂工作节奏可能较快,WLB的信号不明。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

多模态大模型是高速增长赛道,腾讯在该领域投入大,岗位对AI技术发展有直接贡献,意义感较强。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs