Alibaba logo
阿里巴巴
数据技术及产品部-AI数据工程师-LLM/VL方向

数据技术及产品部-AI数据工程师-LLM/VL方向

发布于 大约 7 小时前

普通员工/个人贡献者

北京市 / 杭州市
中级经验
全职员工
仅现场办公
学历未注明
数据工程
Llm
Pytorch
Sql
Tensorflow
Vlm
多模态

AI 估算 · 30k–50k

阿里AI核心岗位,北京/杭州高薪,大模型方向需求旺盛,薪资竞争力强。

职位详情

关于这个职位

该职位负责构建支撑大模型训练的全模态数据体系,包括数据采集、清洗、处理与资产化管理,并设计多模态智能处理模型,使用LLM/VLM/Agent构建自动化数据Pipeline

你将与模型团队紧密协作,通过数据驱动模型能力提升,处于AI技术最前沿

最低要求

职位要求

AI + 数据双栈能力:精通 Python,熟悉 SQL/Shell
理解 LLM、音频/视频模型、多模态模型等基础原理
具有大模型数据构造、清洗、合成或质量评估相关实践经验
多模态数据能力:熟悉文本,或图像/视频/音频中任一模态的特征工程、理解/分类/识别算法或质量建模方法
具备深度学习模型训练实践(PyTorch/TensorFlow)
数据工程基础扎实:熟悉主流大数据平台(Spark/Flink/MaxCompute/Hadoop/RAY)
具备 ETL、数据建模、数据 Pipeline 或数据仓库建设经验
了解大规模文本/图像/视频数据处理者更佳
AI Native 工作流思维:熟悉 Agent、LLM 工具链,对如何将 LLM 融入数据生产、数据分析、数据治理流程有实践经验或强烈兴趣
工程落地能力强:具备良好的工程实现、问题拆解、项目协同能力,能推动数据与模型闭环高效落地

工作职责

职位描述

参与集团级 AI 数据引擎:负责文本、图像、视频、音频等全模态数据的采集、清洗、处理、治理与资产化管理,打造可复用、可观测、可解释的 EB 级数据体系,支撑大模型预训练与后训练的高质量数据供给
多模态数据智能化处理:主导文本、图文、视频、文档、语音等模态的自动理解、标签体系构建、语义特征抽取、质量建模与自动化治理
设计并训练分类、识别、caption、质量打分、预测等模型
AI Native 数据 Pipeline 建设:使用 LLM + VLM + Agent 框架构建智能数据 Pipeline,实现分渠道采集、过滤、去重、质量诊断、标注/改写生成、调度编排与异常告警等环节的自动化,显著降低人力成本
稀缺与高价值数据挖掘:面向网页/PDF/百科/私域/query 等文本场景,以及 real world(巡店/巡检/巡仓)、医疗、教育、OCR、GUI/多模态轨迹等视觉场景,通过"真实采集 + 人工标注 + 模型蒸馏 + 数据合成"四源策略,产出稀缺、高价值、差异化的数据集
数据 & 模型闭环迭代:基于评测反馈的短板,设计对应的专项数据集与合成方案,在训练过程中构建可观测指标,量化数据对模型能力提升的贡献,动态更新数据集,实现"数据—模型—评测—数据"的循环优化
算法与工程一体化协作:与模型团队协作,参与训练数据构造、数据反哺、短板挖掘与评测闭环建设,通过数据驱动模型能力提升,成为 AI 模型训练的数据核心驱动力

优先资格

加分项

在 ACL、EMNLP、NeurIPS、ICLR、AAAI、CVPR、ICCV、ECCV、ACM MM、ICASSP、Interspeech 等顶会有论文,或参与过 LLM、VL、语音、多模态等方向竞赛、开源贡献者优先
有 LLM/VLM/多模态大模型预训练或后训练数据的实战经验
有数据合成(文本合成、图文对合成、渲染/扩散生成)或多模态轨迹数据(GUI/搜索/文件操作)构造经验者优先
熟悉主流评测基准(如 MMLU、MMBench、MM-BrowseComp 等),对数据反哺模型能力提升有实战经验者优先
有小模型/算子训练与加速优化实践经验者优先

AI 洞察

优缺点分析

优点

  • 处于大模型时代最核心的数据环节,技术前沿性高
  • 阿里巴巴平台规模大,能接触EB级数据和全模态场景
  • 与顶尖模型团队协作,个人成长空间大
  • 薪酬待遇在行业内具有竞争力
  • 数据治理与模型训练结合难度大,需要跨领域知识
  • 适合热爱AI技术、具备扎实数据工程和算法基础,希望在大型平台从事前沿数据工作的工程师

缺点 / 挑战

  • 工作强度可能较高,需应对快速迭代的技术要求
  • 对工程能力和算法能力要求双高,持续学习压力大

角色解读

  • 可深耕数据工程与算法结合方向,成为大模型数据专家
  • 有机会向模型训练、评测闭环等核心算法领域拓展
  • 有潜力晋升为技术Leader,带领团队建设数据基础设施
  • 负责全模态数据的采集、清洗、处理与治理,构建EB级数据资产
  • 设计并训练多模态理解、分类、质量打分等模型,用于自动化数据治理
  • 使用LLM、VLM和Agent框架开发自动化数据Pipeline,覆盖采集到标注全流程
  • 与模型团队协作,基于评测反馈迭代数据方案,实现数据模型闭环优化
  • 精通Python和SQL/Shell,熟悉大数据框架如Spark、Flink、MaxCompute等
  • 理解深度学习原理,掌握PyTorch或TensorFlow,具备模型训练实践经验
  • 了解LLM、多模态模型原理,有数据构造、清洗、合成或质量评估经验
  • 具备Agent和LLM工具链应用经验,能够将AI融入数据生产流程

申请策略

  • 准备一个能体现端到端数据Pipeline能力的项目案例
  • 了解阿里巴巴AI数据团队的业务方向,在面试中展现对数据驱动模型的理解
  • 突出大型数据处理项目经验,特别是涉及多模态数据或大模型数据供给的案例
  • 强调模型训练和调优实践,附上具体的量化成果
  • 展示使用Spark/Flink等大数据框架解决实际问题的能力
  • 如有LLM/Agent相关项目或开源贡献,务必重点提及
  • 补充学习LLM和VLM的最新应用,尝试用LangChain或类似框架搭建数据处理Agent
  • 熟悉数据合成技术,包括文本生成、图文对合成等方法

面试指南

  • 采用STAR法则:情境-任务-行动-结果,清晰描述项目背景、个人职责、具体做法和成效
  • 注重逻辑拆解:先定义问题,再分析原因,最后给出可量化的解决方案和验证结果
  • 展现技术敏锐度:将问题与技术趋势结合,展示你对新技术的理解和应用能力
  • 请介绍一个你参与的大数据处理项目,以及遇到的挑战和解决方案
  • 如何评估一个数据集的质量?有哪些指标和方法?
  • 如何使用LLM或Agent来自动化清洗和处理非结构化数据?
  • 你如何设计一个数据合成方案来解决训练数据不足的问题?
  • 在构建数据Pipeline时,如何确保数据的一致性和可观测性?

职位点评

75
综合评分

大厂核心AI数据岗,前沿技术栈,发展空间大,但可能需要承受加班压力。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合看重技术成长和行业前景的求职者,对工作生活平衡要求不太高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值85

薪资福利

75中等

阿里巴巴提供有竞争力的薪酬和福利,但未在JD中明确,整体满足程度较高。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

90较高

职位涉及LLM/VLM等前沿技术,有大量学习和成长机会,发展性动机得到充分满足。

技术前沿前沿/新兴技术
技术栈Python、Spark、Flink、PyTorch、TensorFlow、LLM、VLM、Agent、多模态、数据合成
业务类型ambiguous

工作生活

50较低

未提及远程或弹性工作,大厂节奏可能较快,生活化动机满足有限。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

大模型是高速增长赛道,该岗位对AI发展有重要价值,意义感较强。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs