
字节跳动
智能模型数据平台工程师-AI Data
智能模型数据平台工程师-AI Data
发布于 大约 8 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
仅现场办公
本科
数据工程
Data Agent
Go
向量数据库
大模型
数据湖
AI 估算 · 30k–60k
字节跳动上海数据平台资深工程师,大模型基础设施方向,技术栈前沿,薪资竞争力强,通常15薪。
职位详情
关于这个职位
作为字节跳动Seed大模型数据平台工程师,你将负责建设大模型数据全生命周期管理平台,涵盖数据生产、管理、消费和质量控制,并参与构建Data Agent和AI-Native数据平台
该职位涉及高性能分布式系统的设计与开发,支撑PB级数据处理,是算法预训练和SFT/RLHF的关键基础
你将与基础架构和云平台团队协作,主导技术选型与架构优化,使用Spark/Flink/Ray等前沿技术栈
适合对大数据和AI基础设施有热情、追求技术深度的人
最低要求
本科及以上学历,计算机相关专业
精通Python、Java、Go等至少一种编程语言,有服务端开发经验,具备良好的编码能力和代码质量意识
至少精通以下引擎/架构之一:Spark/Flink/Ray等大数据处理引擎,Hudi/Iceberg/Paimon等数据湖,及Doris/ClickHouse等OLAP引擎,PyTorch/TensorFlow等机器学习框架,索引与搜索架构
在线上有实践经验,有源码阅读经验,有引擎二次开发经验优先
对业务敏感,能快速理解业务背景,具备优秀的技术与业务结合能力,有较好的需求抽象能力和架构能力
学习能力强,能够快速学习完全没有涉猎过的新技术,并快速应用于工程实践
工作职责
围绕Seed大模型数据全生命周期,建设Seed大模型海量数据的管理/生产/消费/质量的统一平台,提升大模型数据全生命周期的使用效率与质量,赋能算法预训练、SFT/RLHF等场景
构建大模型领域的Data Agent,重构AI-Native的数据平台范式
协同基础架构/云平台团队,搭建稳定高效的底层数据基础设施(数据湖、对象存储、分布式计算、大规模数据检索、数据血缘系统,调度引擎,算力平台等)
主导技术选型与架构优化,基于Spark/Flink/Ray、湖仓一体、向量数据库,调度引擎等技术栈,构建高吞吐、高容错、可扩展的处理存储能力,支撑日PB级数据处理
优先资格
大数据平台生产与管理开发经验
大模型数据抓取、加工,合成应用于预训练、SFT/RLHF的实践经验
Agent项目开发经验,了解当前Agent架构实践
良好的AI Coding实践者,有将Harness Engineering应用于实际开发工作经验
AI 洞察
优缺点分析
优点
- 处于大模型爆发期,数据是核心资产,该岗位涉及前沿技术栈,能积累宝贵的AI基础设施经验,技术成长空间大
- 工作内容涵盖数据平台全链路,从底层基础设施到上层Data Agent,既能深入引擎底层,又能接触AI应用,技术广度与深度兼得
- 公司技术氛围浓厚,鼓励技术创新,有优秀的技术同事和丰富的内部工具,利于快速成长
- 工作强度可能较大,字节跳动以高效和快节奏著称,需要适应高圧力的工作环境
- 技术栈复杂,涉及大数据引擎、数据湖、AI框架等,要求持续学习,对个人学习能力和抗压能力要求高
- 大模型数据领域变化快,需求可能频繁调整,需要较强的业务理解和沟通能力,推动跨团队协作
- 适合对大数据和AI基础设施有强烈兴趣,追求技术前沿、学习能力强、能适应快节奏的工程师
缺点 / 挑战
- 字节跳动作为互联网巨头,平台大,资源多,可以接触大规模分布式系统,处理日PB级数据,挑战性强
角色解读
- 从数据平台工程师成长为技术专家,深入大数据引擎、数据湖、大模型数据基础设施等方向,成为领域权威
- 可转向AI Infra架构师或技术负责人,负责更大规模的数据平台整体架构设计和技术决策,带团队
- 随着大模型和AI Agent发展,有机会在数据智能、AI-Native平台等前沿领域持续深耕,拓展技术视野和影响力
- 建设大模型数据全生命周期管理平台,包括数据生产、管理、消费和质量统一管控,支撑算法团队的预训练和SFT/RLHF数据需求
- 构建大模型领域的Data Agent,探索AI-Native的数据处理范式,使数据平台具备智能化和自动化能力
- 协同基础架构团队搭建底层数据基础设施,涵盖数据湖、对象存储、分布式计算、数据血缘、调度引擎等,确保系统高吞吐、高容错和可扩展
- 主导技术选型与架构优化,应用Spark/Flink/Ray、湖仓一体、向量数据库等技术栈,解决日PB级数据处理的性能瓶颈
- 精通至少一种服务端编程语言(Python/Java/Go),具备优秀的编码和工程实践能力
- 深入掌握至少一种大数据处理引擎(Spark/Flink/Ray)或数据湖技术(Hudi/Iceberg/Paimon),有线上大规模实践经验
- 熟悉OLAP引擎(Doris/ClickHouse)或机器学习框架(PyTorch/TensorFlow)或索引搜索架构,能进行引擎调优或二次开发
- 对业务敏感,具备抽象需求和架构设计能力,能够将技术与业务场景高效结合,同时有快速学习新技术的能力
申请策略
- 投递前了解字节跳动Seed团队的业务方向,在简历和面试中展现对AI数据平台的理解和热情
- 准备一个关于大数据平台架构演进或性能优化的项目故事,展示技术深度和业务结合能力
- 突出大数据平台或分布式系统开发经验,特别是使用Spark/Flink/Ray等引擎的实际项目,包括数据量、性能指标和架构设计
- 展示对数据湖技术(Hudi/Iceberg/Paimon)或OLAP引擎的深入理解,如有源码阅读或二次开发经历,一定要重点描述
- 如果参与过大模型数据相关项目(预训练数据清洗、SFT/RLHF数据构建)或Agent开发,务必放在显眼位置
- 强调编程能力、代码质量和架构设计能力,可以用具体代码示例或开源贡献佐证
- 提前学习大模型数据全生命周期流程,了解预训练、SFT/RLHF对数据的要求,动手跑通一个小型数据处理Pipeline
- 深入学习至少一种数据湖技术(如Hudi)的内部原理和源码,了解湖仓一体架构,练习性能调优
面试指南
- 用STAR法则组织项目经历,突出技术挑战、方案选型、落地效果和个人贡献
- 对于技术对比问题,从场景、性能、容错、生态等维度分析,体现系统性思考
- 对于设计类问题,先拆解需求,再给出高层次的架构图(可手画),然后深入细节,注意权衡取舍
- 请介绍一个你主导设计的大数据处理系统,包括架构选型、关键技术难点和解决方案
- 你对Spark和Flink有什么更深入的理解?在什么场景下选择Spark,什么场景选择Flink?
- 如何设计一个面向大模型训练的数据处理流水线?需要哪些模块?如何保证数据质量和效率?
- 谈谈你对数据湖和湖仓一体的理解,如何解决数据一致性和查询性能问题?
- 你了解Data Agent吗?如果让你设计一个Data Agent,你会考虑哪些核心能力?
职位点评
67
综合评分
前沿大模型数据平台、技术挑战大、成长空间足,但薪资面议且工作强度未知。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合重视技术成长、渴望从事大模型基础设施前沿工作,且能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展85
工作生活50
使命价值70
薪资福利
60中等
薪资未明确披露,但字节跳动薪酬在行业内具有竞争力,且数据平台工程师属于高价值岗位,整体补偿水平较高。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
85较高
岗位涉及大模型数据全生命周期、Data Agent等前沿方向,技术栈新且挑战大,有丰富的学习和成长机会,但JD中未明确提及晋升路径等。
技术前沿前沿/新兴技术
技术栈Python、Java、Go、Spark、Flink、Ray、Hudi、Iceberg、Paimon、Doris、ClickHouse、PyTorch、TensorFlow、向量数据库、大模型、Data Agent、湖仓一体
业务类型ambiguous
工作生活
50较低
JD中未说明远程或弹性工作,工作地点为上海,字节跳动通常为现场办公,且未提及WLB相关福利,因此生活方式满意度一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
大模型数据基础设施是AI发展的关键环节,岗位对技术前沿和行业有显著贡献,但JD未强调直接社会价值,意义感适中。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
字节跳动 的其他在招职位
相似职位推荐
Watch Jobs