
字节跳动
机器学习数据工程师-Data AML
机器学习数据工程师-Data AML
发布于 大约 2 个月前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
学历未注明
软件工程
多模态数据
广告
推荐系统
数据仓库
机器学习
SQL
AI 估算 · 30k–50k
字节跳动大厂中高级数据工程师,技术要求高,薪资有竞争力,预计月薪3-5万,15薪。
职位详情
关于这个职位
加入字节跳动Data AML团队,负责推荐、广告、搜索业务的多模态数据生产链路搭建与优化
你将设计数据去重、过滤及特征缓存体系,与算法团队深度协同,将系统与模型联合优化,支撑亿级业务场景
适合有大数据经验并希望深入机器学习领域的工程师
最低要求
熟悉数据仓库实施方法论、深入了解数据仓库体系,并支撑过实际业务场景
熟练使用Spark和Hive等,熟悉SQL、Java、Python等编程语言
善于沟通,对业务敏感,能快速理解业务背景,具备优秀的技术与业务结合能力
有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速的响应和行动
有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档
工作职责
负责字节跳动推荐/广告/搜索类业务中多模态数据生产链路的搭建
多模态结合搜推特征的生产:针对多模态模型特点,进行数据去重,过滤,SPAM数据处理,数据均衡等操作,并且将生产链路平台化
构建多模态特征缓存体系:针对多模态特征特点,构建存储体系,显著提高数据访问吞吐,降低延迟
参与构建多模态模型的上线链路:将历史数据批量写回链路以及实时数据生产链路平台化,支持模型上线
算法-系统联合优化:与算法团队深度协同,推进算法与系统的联合优化,持续提升系统对业务的支撑能力
优先资格
熟悉至少一种主流的机器学习框架(PyTorch/TensorFlow)
在大模型或推荐模型领域,参与过大影响力的项目或论文
AI 洞察
优缺点分析
优点
- 接触多模态、大模型等前沿技术,与优秀算法团队合作,学习成长快
- 薪资福利在大厂中具有竞争力,且15薪制
- 团队竞争激烈,需要持续学习和快速产出
- 适合具有大数据背景、对机器学习感兴趣、渴望在技术前沿快速成长的工程师
缺点 / 挑战
- 字节跳动大平台,业务场景丰富,数据量级巨大,技术挑战高
- 业务压力大,可能面临较高的工作强度和加班
- 技术栈要求深,需要同时掌握数据工程和机器学习,门槛较高
角色解读
- 技术深耕:成为大数据架构师或数据平台专家
- 跨界发展:向算法工程师转型,专注多模态或推荐模型
- 管理路线:担任技术负责人,带领团队负责数据基础设施
- 设计和搭建多模态数据的生产链路,包括数据采集、去重、过滤、均衡等处理流程
- 构建多模态特征缓存体系,优化数据访问吞吐和延迟,支撑高并发业务
- 参与模型上线链路建设,实现历史数据批量写回和实时数据生产平台化
- 与算法团队深度协同,进行系统与模型的联合优化,提升业务效果
- 精通大数据技术栈,包括Spark、Hive,并能熟练使用SQL、Java、Python
- 深入理解数据仓库方法论,有实际业务场景支撑经验
- 了解机器学习框架(如PyTorch/TensorFlow)和多模态数据处理原理
- 具备优秀的沟通能力和业务理解力,能够将技术方案与业务需求结合
申请策略
- 准备一个从数据到模型端到端的项目案例,突出技术难点和解决方案
- 了解字节推荐/广告/搜索业务的基本流程,展示业务理解
- 突出数据仓库项目经验,展示对数据处理的深刻理解
- 强调Spark/Hive等大数据技术的实际应用和性能优化案例
- 如果有机器学习项目或论文经历,重点描述与多模态或推荐相关的部分
- 体现跨团队协作和技术与业务结合的能力
- 学习PyTorch或TensorFlow,了解多模态模型的基本原理
- 熟悉数据缓存和存储系统设计(如Redis, HBase)
面试指南
- 使用STAR法则:描述场景、任务、行动和结果
- 技术问题先阐述原理,再给出具体方案和对比
- 项目问题强调你的角色、技术选型原因和量化成果
- 如何优化Spark作业的数据倾斜问题?
- 多模态数据包含哪些类型?如何处理不同模态的对齐和融合?
- 设计一个多模态特征缓存系统,要求高吞吐低延迟
- 请分享一个你主导的数据生产链路项目,遇到的最大挑战是什么?
- 如何评估和验证多模态特征对推荐模型的收益?
职位点评
68
综合评分
字节跳动前沿技术岗,高成长高薪资,但工作节奏快,生活平衡一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、渴望接触前沿、能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活40
使命价值70
薪资福利
70中等
字节跳动薪资在行业中偏高,但JD未明确福利和薪资,补偿性中等偏上。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
85较高
岗位涉及多模态、大模型等前沿技术,与算法团队深度协同,成长空间大。
技术前沿前沿/新兴技术
技术栈Spark、Hive、Java、Python、多模态、机器学习、大模型
业务类型profit_center
工作生活
40较低
北京现场办公,未提及弹性工作,互联网大厂通常加班较多,生活平衡较弱。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
所属推荐/广告业务是互联网核心,行业增长快,但社会影响力中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
字节跳动 的其他在招职位
相似职位推荐
Watch Jobs