
蚂蚁集团
蚂蚁集团-AI数据工程师-杭州
蚂蚁集团-AI数据工程师-杭州
发布于 大约 14 小时前普通员工/个人贡献者
杭州市
中级经验
全职员工
仅现场办公
本科
数据工程
Hivesql
Java/Go
Prompt
大模型
数据仓库
数据治理
AI 估算 · 30k–50k
杭州头部互联网大厂,AI数据方向需求旺盛,技能要求高,薪资有竞争力,通常15-16薪。
职位详情
关于这个职位
作为蚂蚁集团AI数据工程师,你将参与构建AI数据资产与治理体系,支持AGI业务发展
工作涉及大模型数据处理、数据清洗、数据仓库建设等,需要扎实的数据工程基础和AI应用能力
你将与算法、产品团队紧密协作,推动数据驱动的业务增长
最低要求
基础要求:
计算机、软件工程、系统科学与工程等相关专业本科及以上学历,毕业于海内外知名高校优先
有头部互联网公司大模型数据集经验优先
会用AI、善用AI,使用AI工具解决过某一专业场景的问题或参与AI相关项目研究/竞赛
理解大模型的应用与优化,能结合业务场景设计高效Prompt或微调方案,熟悉Agent工作流,具备多Agent协同开发经验更佳
精通Python/Java/Go编程及常用数据处理库(如Pandas, NumPy),熟练掌握至少一种大数据处理工具(如Spark, HiveSQL)
年以上扎实的数据工程、数据仓库或后端开发经验,或者至少1年专注于大模型数据集建设、大规模文本数据清洗或相关领域
工作职责
全力保障AGI业务达成:构建高效主动、科学可持续的AI数据资产与治理体系(全网URL库、DataMap、数据价值主动发现、GPU算力资源优化、语料价值评估与分析、AI通用语料沉淀),推动数据团队从被动服务向主动增长模式演进,助力AGI业务(如阿福、金融大模型、百灵等)高效、低成本达成目标
为业务增长提供核心驱动力:通过构建高质量、深度融合的“智能/价值资产基座”(用户智能化基座模型、商品标品化数据),系统性积累与扩充数据资产,并利用智能化应用范式充分释放数据价值,为业务增长提供核心驱动力
助力集团数据业务全面智能化转型:构建AI原生可理解、高品质、智能化的集团数据服务体系(风险、资金、财务),打造标品化产品数据解决方案,大幅提升数据研发的交付效率和业务决策效率,帮助集团业务更高效的从运营向智能化经营转型
前沿探索与工具开发:跟踪大模型数据领域的前沿技术(如数据合成、智能标注等),开发或引入先进工具,持续提升数据生产的效率与质量
优先资格
加分项:
有AI提效相关工具使用或项目落地经验,有处理文本、PDF、图像、音视频等非结构化数据的实战经验(如 PDF 解析、OCR 后处理、音视频转写等)
有架构治理项目落地经验(如合规治理、风险治理、成本治理等),具备数据资产估值方法论研究背景,具备从零到一构建大规模数据清洗Pipeline并成功支持大模型训练项目的经验
参与过AI模型训练数据评估项目,有GPU集群调度(如K8s弹性策略)实战经验,熟悉语料生成/标注平台开发或LLM数据供应链管理
对算法有理解,有算法应用经验
与产品、算法、工程团队紧密协作,推动AI Agent的落地和规模化应用
关注行业前沿技术动态,持续学习和探索领先的技术方案
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台大,业务场景丰富,数据量庞大,能积累大规模数据处理经验
- 涉及大模型数据等前沿技术,技术成长快,行业前景好
- 有机会参与核心AGI业务,对个人履历有较大提升
- 薪酬福利有竞争力,公司稳定性高
- 数据工作往往繁琐复杂,需要较强耐心和细致度
- 大模型技术迭代迅速,需要持续学习和适应
缺点 / 挑战
- 可能面临较高的工作强度和交付压力
- 适合有较强数据工程基础,对大模型技术充满热情,愿意在快节奏环境中挑战自我的求职者
角色解读
- 向AI数据专家或数据架构师方向发展,主导数据体系建设
- 转型大模型算法/训练工程师,深入模型优化与训练
- 成长为数据团队负责人,管理数据平台和团队
- 构建和管理大规模AI训练数据管道,包括数据采集、清洗、评估和治理
- 开发数据治理工具,优化GPU算力资源利用,支持大模型训练
- 与算法、产品团队协作,设计Prompt或微调方案,推动AI Agent落地
- 探索数据合成、智能标注等前沿技术,提升数据生产效率和质量
- 精通Python/Java/Go及常用数据处理库(Pandas, NumPy)
- 熟练掌握Spark、HiveSQL等大数据处理工具
- 理解大模型原理,能设计高效Prompt或微调方案,熟悉Agent工作流
- 具备数据工程、数据仓库或后端开发经验,熟悉数据治理和架构
申请策略
- 提前了解蚂蚁集团在AI领域的最新布局,面试时展现行业认知
- 准备能体现数据驱动业务增长的实际案例,突出影响力
- 突出大数据处理和ETL管道建设项目,体现数据清洗、治理能力
- 强调使用AI工具解决问题的经历,展示Prompt优化或微调项目
- 如有大模型数据集建设或大规模文本清洗经验,重点描述
- 展现编程能力,尤其是Python/Java/Go的实战应用
- 学习大模型技术栈,如LLM、RAG、Agent框架,并动手实践
- 熟悉Spark、K8s等大数据和容器调度工具,掌握数据管道调优
面试指南
- 使用STAR法则(情境-任务-行动-结果)组织项目经验,突出个人贡献和量化结果
- 强调结合业务场景,体现技术选型和架构设计的合理性
- 展示持续学习和探索精神,提及关注的前沿技术方向
- 如何构建一个高质量的大规模文本清洗管道?请描述技术方案和难点
- 你如何设计一个Prompt来优化大模型在特定业务场景的输出?
- 谈谈你参与过的数据治理项目,主要解决了什么问题?
- 如何处理非结构化数据(如PDF、OCR、音视频)用于大模型训练?
- 你对Agent工作流的理解是什么?在多Agent协同中遇到过哪些挑战?
职位点评
72
综合评分
大厂AI数据工程师,前沿技术栈,高成长性和薪资竞争力,但工作地点固定,WLB信息不明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术前沿、渴望快速成长,且愿意接受现场办公和不确定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展88
工作生活40
使命价值70
薪资福利
80较高
蚂蚁集团平台实力雄厚,薪资福利在行业内具有竞争力,但具体数字未在JD中明确,整体补偿性较好。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
88较高
职位涉及大模型数据等前沿领域,技术挑战大,成长空间广阔,公司重视数据驱动,有助于技能提升和职业发展。
技术前沿前沿/新兴技术
技术栈大模型、Agent、Prompt、数据治理、Spark、HiveSQL、GPU
业务类型profit_center
工作生活
40较低
JD未提及远程或弹性办公,要求现场办公,加班情况未知,生活化动机满足有限。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI大模型行业高速发展,职位支撑集团核心AGI业务,具有一定社会影响,但JD未强调使命导向,意义感中等偏上。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs