
腾讯
腾讯游戏-多模态大模型数据工程师/专家
腾讯游戏-多模态大模型数据工程师/专家
发布于 大约 14 小时前普通员工/个人贡献者
杭州市
中级经验
全职员工
仅现场办公
本科
数据工程
多模态数据处理
数据存储
数据清洗
特征提取
AI 估算 · 30k–50k
多模态大模型方向需求旺盛,腾讯平台薪酬竞争力强,预计月薪3-5万,16薪。
职位详情
关于这个职位
该职位负责多模态大模型的数据生产与处理Pipeline建设,包括数据清洗、质量筛选、存储检索等
你将对接视频/图片/音频等多模态数据需求,使用Ray、Spark等分布式框架,支撑业界领先的生成模型训练
适合有服务端和大数据处理经验、对AI数据工程感兴趣的技术人才
最低要求
计算机、软件工程、数学、电子信息、自动化等相关专业,本科及以上学历
计算机基础扎实,熟练掌握Java/C++/Python语言中的一种,有服务端系统的开发经验
熟练掌握文本、多模态等非结构化数据处理方法,熟悉数据清洗、特征提取和数据增强等技术
熟悉分布式计算或大数据处理框架,了解Ray、Spark、Hadoop、Flink相关技术栈
聪明好学,有较强的自驱力和学习力,良好的沟通协作能力
工作职责
对接视频/图片/音频等各类多模态模型的数据生产需求,打造业界领先的数据生产引擎,持续提升数据规模、质量与迭代效率,支撑多模态生成模型训练
搭建Data-Centric多模态数据处理Pipeline,覆盖算子开发、跨模态检索、内容理解及质量筛选等关键环节
构建高可用、高吞吐的数据存储和服务框架,持续优化多模态数据的存储以及检索效率
AI 洞察
优缺点分析
优点
- 多模态大模型是当前AI最热方向,技术成长快,履历含金量高
- 腾讯平台资源丰富,数据规模大,能接触业界领先的工程实践
- 岗位核心性强,与算法团队深度协作,个人影响力大
- 对综合能力要求高,既需要工程开发能力,又需要理解数据处理和模型训练需求
- 数据Pipeline复杂,涉及多技术栈,排错和优化难度大
- 适合热爱AI数据工程、有分布式系统开发经验、愿意在快节奏技术环境中深入钻研的工程师
缺点 / 挑战
- 大模型领域节奏快,可能有工作强度压力
角色解读
- 从数据工程师向AI基础设施专家发展,深入多模态大模型训练的数据链路
- 可转向机器学习平台、数据架构或AI算法方向,积累数据与模型双重视角
- 在腾讯大平台有广阔的晋升空间,可成长为技术专家或团队负责人
- 负责多模态数据的生产需求对接,构建数据生产引擎,提升数据规模、质量与迭代效率
- 搭建Data-Centric多模态数据处理Pipeline,包括算子开发、跨模态检索、内容理解与质量筛选
- 构建高可用、高吞吐的数据存储与服务框架,优化多模态数据的存储和检索效率
- 扎实的计算机基础,熟练掌握Java/C++/Python中的一种,有服务端系统开发经验
- 熟悉多模态等非结构化数据处理,包括数据清洗、特征提取和数据增强技术
- 掌握分布式计算或大数据框架,如Ray、Spark、Hadoop、Flink
申请策略
- 了解腾讯多模态大模型业务方向(如混元、AI生成内容),在面试中展现热情
- 主动询问团队技术栈和数据规模,显示对岗位的深入思考
- 突出服务端系统开发经验和大型分布式项目实践
- 展示参与过的数据处理Pipeline或大数据平台项目,强调性能优化成果
- 如果有AI相关经历,如数据清洗、特征工程、模型训练数据构建,重点描述
- 体现学习能力和自驱力,比如开源贡献、技术博客
- 熟悉Ray或Spark等框架的底层原理,能够进行调优
- 补充多模态数据相关基础知识,如跨模态检索、内容理解
面试指南
- 结合项目实际,描述背景-动作-结果,突出技术选型和量化收益
- 从数据质量对模型影响的角度谈Data-Centric,强调数据清洗和增强的实践
- 比较框架时关注数据规模、实时性、计算模型等维度
- 请介绍一个你设计过的大数据处理Pipeline,包括架构、挑战和优化
- 如何处理多模态数据的质量筛选?有哪些方法?
- 讲一下你对Data-Centric AI的理解
- 如何设计一个高吞吐的数据存储服务?
- Ray和Spark的适用场景有什么区别?
职位点评
67
综合评分
腾讯多模态大模型数据工程师,技术前沿、薪资可观,但工作节奏和办公灵活性未知。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、对AI前沿有热情的工程师,对WLB要求较高者需谨慎评估。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展85
工作生活50
使命价值75
薪资福利
60中等
薪资未明确披露,但腾讯平台和热门方向预计薪资有竞争力,具体待谈。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
85较高
岗位涉及多模态大模型前沿技术,能接触大规模数据处理和分布式系统,技术成长空间大。
技术前沿前沿/新兴技术
技术栈多模态、Data-Centric、Ray、Spark、Hadoop、Flink、Java、C++、Python、数据清洗、特征提取
业务类型ambiguous
工作生活
50较低
工作地点杭州为现场办公,未提及远程或弹性工作,WLB信息不明确。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
75中等
多模态大模型是高速发展的AI赛道,工作有技术价值,但对社会的影响主要体现为技术推动。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
腾讯 的其他在招职位
相似职位推荐
Watch Jobs