Alibaba logo
阿里巴巴
数据技术及产品部-大模型数据处理研发工程师/专家-AIData

数据技术及产品部-大模型数据处理研发工程师/专家-AIData

发布于 大约 14 小时前

普通员工/个人贡献者

北京市 / 杭州市
高级经验
全职员工
仅现场办公
本科
数据工程
Dataworks
Etl
Hudi
Maxcompute
Odps
多模态
大模型
数据治理
数据湖

AI 估算 · 35k–60k

大模型数据平台方向,技术门槛高,大厂薪资竞争力强,5年以上经验对应高薪区间。

职位详情

关于这个职位

该职位隶属阿里巴巴数据技术及产品部,专注大模型数据处理与资产化体系建设

你将负责构建自动化、可扩展的数据处理平台,涵盖数据接入、加工、治理与沉淀,并与算法团队协作,支撑高质量数据供给
适合具备大数据处理经验,对技术前沿充满热情的数据工程师

最低要求

本科及以上学历,计算机相关专业

具备数据处理或模型训练经验
熟练掌握文本、多模态等非结构化数据处理方法,精通数据清洗、去重、相似度计算、脱敏、特征提取与数据增强等技术
精通Python、Java中至少一种,熟悉常用的数据、文本与图像处理库,能高效实现数据清洗与处理的算法和流程
具备丰富的数据湖开发经验(Hudi/Iceberg/Hive等),对数据计算框架(Spark/Flink/Hadoop/Ray)有深入实践与理解
熟悉ODPS/MaxCompute、OSS与调度平台(如DataWorks)
具备良好的数据建模、ETL与数据质量治理能力,能解决数据工作中的各类复杂问题
良好的团队协作与沟通能力,责任心强,能推动项目进展

工作职责

负责大模型数据处理与资产化体系的建设,围绕数据的接入、加工、治理与沉淀构建自动化、可扩展的处理能力,保障高质量数据的持续供给

抽象通用的数据处理与质量治理框架,将各类数据加工与清洗诉求沉淀为标准化、可复用、自动化的平台组件,提升处理效率与工程质量
建设数据资产化与全生命周期治理能力,实现数据的规范化沉淀、统一管理与可追溯,推动多来源数据的融合与统一
与算法及平台团队紧密协作,把复杂的数据处理需求转化为平台化、自动化能力,持续提升整个团队的数据处理与供给能力

优先资格

● 主导过大模型或离在线场景下的数据平台/海量数据处理建设

具备分布式采集、高并发或过亿量级数据处理经验者优先
● 分布式采集与反爬策略、数据挖掘经验
● 大模型训练数据集建设、数据血缘与全生命周期治理经验
了解LLM/多模态数据建设原理

AI 洞察

优缺点分析

优点

  • 身处大模型前沿赛道,技术更新快,有广阔的学习和成长空间
  • 阿里巴巴平台规模大,数据量级高,能接触世界级的分布式数据处理技术
  • 职位涉及平台化建设,有较强的技术深度和影响力
  • 大模型数据处理对技术广度和深度要求高,需持续学习新框架和工具
  • 数据平台工作偏底层与支撑,需要耐心处理复杂的数据问题
  • 适合技术自驱力强、热爱大数据与大模型方向,希望参与核心数据基础设施建设的工程师

缺点 / 挑战

  • 大厂工作节奏较快,可能需要应对较大工作压力和紧急需求

角色解读

  • 可深耕大数据与AI数据工程领域,成为数据平台架构师或技术专家
  • 可向大模型训练数据方向深入,参与核心数据资产建设,成为AI基础设施关键角色
  • 有广阔的内部转岗和晋升空间,可逐步带领团队负责更整体性的数据体系
  • 负责建设大模型数据处理与资产化体系,包括数据接入、加工、治理与沉淀,保障高质量数据供给
  • 抽象通用数据处理框架,开发标准化、可复用的自动化组件,提升处理效率
  • 与算法团队协作,将复杂数据处理需求转化为平台化能力,支持大模型训练数据的持续产出
  • 精通Python或Java,熟悉数据处理库和算法实现
  • 熟悉数据湖(Hudi/Iceberg/Hive)和数据计算框架(Spark/Flink/Hadoop/Ray),掌握ODPS/MaxCompute等阿里云组件
  • 具备数据建模、ETL和数据质量治理的实践经验
  • 了解大模型/多模态数据处理原理,熟悉数据清洗、去重、相似度计算等技术

申请策略

  • 了解阿里巴巴的数据中台和大模型业务,在面试中展现对平台化建设的思考
  • 强调跨团队协作能力,因为职位需要与算法、平台团队紧密配合
  • 突出在大数据平台或海量数据处理项目中的实际成果,如处理数据量、性能优化等
  • 强调熟悉的数据技术栈,尤其是Spark/Flink、数据湖和阿里云组件
  • 如有大模型数据处理经验,需重点展示
  • 量化ETL和质量治理的效率提升,体现解决问题的能力
  • 补充对数据湖格式(Hudi/Iceberg)和数据编排工具的深入理解
  • 学习大模型训练数据的构建流程,了解数据清洗、去重、增强的常用方法

面试指南

  • 用STAR法则(情境、任务、行动、结果)结构化描述项目经历,突出技术选型和效果
  • 展示系统性思考,从数据接入、处理、治理、监控等全链路考虑,提出可扩展的架构
  • 结合阿里云组件阐述方案,体现对平台工具链的熟悉
  • 请描述你在大数据平台建设中解决过的一个复杂技术问题
  • 如何设计一个大规模数据清洗和去重的自动化流程?
  • 谈谈你对数据湖和数据仓库的理解,以及在实际项目中的应用
  • 如果让你构建一个面向大模型训练的数据处理工具链,你会如何设计?
  • 如何保证数据质量和可追溯性?

职位点评

68
综合评分

大厂大模型数据方向,技术前沿,薪资竞争力强但工作强度未知。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和行业前沿,能接受现场办公的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利65
成长发展85
工作生活50
使命价值70

薪资福利

65中等

职位未明确薪资福利,但阿里巴巴平台提供有竞争力的薪酬预期。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

85较高

职位处于大模型与大数据前沿,技术栈新,成长空间大,能显著提升数据工程能力。

技术前沿前沿/新兴技术
技术栈Python、Java、Spark、Flink、Ray、Hudi、Iceberg、Hive、ODPS、MaxCompute、DataWorks、数据湖、大模型、多模态
业务类型ambiguous

工作生活

50较低

仅明确现场办公,未提及弹性或加班情况,工作强度未知。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

70中等

大模型是高速增长领域,职位对AI基础设施有重要价值,但直接社会影响不明显。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs