SAP logo
思爱普
Data Engineer

Data Engineer

发布于 大约 3 小时前

普通员工/个人贡献者

上海市
中级经验
全职员工
混合式弹性办公
本科
数据工程
CI/CD
Pyspark
Sql
数据治理

AI 估算 · 25k–40k

上海外企数据工程师,3年以上核心技能,薪资处于市场中高水平。

职位详情

关于这个职位

本职位是SAP服务与支持数据湖团队的数据工程师,负责设计可扩展的数据管道、实时与批量数据接入、元数据和数据治理,并为AI服务提供数据支持

你将参与从孤立管道向统一智能平台的演进,推动自服务分析和自主数据代理的建设
适合具备Python、Spark和SQL经验,对数据治理和AI原生数据工程感兴趣的技术人才

最低要求

· 学士学位或同等实践经验

· 3年以上Python(pandas, pytest)和SQL编码经验
· 3年以上Spark/大数据处理经验(PySpark):转换、分区、性能优化
· 3年以上设计和部署数据管道经验,包括管理数据模式和处理高容量工作流
· 扎实的软件工程基础:干净代码、模块化设计、调试、版本控制和可维护文档
· 扎实的SQL和数据建模能力(规范化和反规范化模式、数据契约、模式演化)
· 实践测试和发布实践:单元/集成测试、CI/CD管道和安全生产发布
· 可观测性和运维经验:指标、日志、警报和友好的故障处理
· 有SQL数据库(优先PostgreSQL,其他可接受)和NoSQL数据库(必需Elasticsearch和Delta Lake)经验
· 有实时和批量接入经验(API - 轮询和推送、Kafka流)
· 有工作流编排经验(Kubeflow Pipelines、Airflow、Prefect或Dagster)
· 有数据治理经验:数据脱敏、匿名化和PII处理
· 熟练使用Git工作流:分支策略、代码审查、CI/CD集成

工作职责

· 设计和维护具有清晰架构和高质量标准的可扩展管道

· 构建来自不同来源的实时和批量接入,并自动验证
· 编写生产级代码,具备严格的测试纪律(单元/集成测试)、代码审查质量、可维护的模块化设计
· 端到端排查复杂数据问题,包括根本原因分析、性能瓶颈和可靠性事件
· 实施与治理要求一致的匿名化和PII控制
· 开发元数据管道,用于模式剖析、业务上下文提取和血缘追踪
· 为语义层做出贡献,将技术字段映射到业务术语,用于自服务和自然语言分析用例
· 使用AI辅助开发实践加速交付和维护
有自主代理经验更佳
· 建立监控、警报和数据质量控制,确保安全可靠的分析资产,基于数据科学要求评估其AI/ML就绪性
· 与Tech Lead和架构师合作,将需求转化为生产系统

优先资格

· 5年以上设计企业级数据平台和分析基础设施经验

· 熟悉LLM支持的数据应用,包括从数据平台角度的RAG、嵌入、向量搜索和评估
· 有构建支持AI相关应用和分析产品的数据服务和数据API经验
· 有生产化支持机器学习和智能应用的数据和特征管道经验
· 对AI原生数据工程和代理式数据工作流(包括编排、工具集成、评估和工作流自动化)有浓厚兴趣
· 了解MLOps/LLMOps原则,确保文本处理和脱敏管道的可扩展、可靠部署
· 有monorepo或共享库架构模式经验
· 能够在模糊性中操作并影响跨职能技术决策
· 具备采用新兴数据概念(例如数据代理和语义层模式)的学习敏捷性

AI 洞察

优缺点分析

优点

  • 参与建设端到端智能数据平台,技术栈前沿,个人成长空间大
  • 公司平台稳定,有完善的学习资源和内部流动机会
  • 团队文化强调共享与质量,能培养严谨的工程习惯
  • 接触AI代理、LLM等未来数据工程方向,职业前景广阔
  • 需同时掌握数据工程、数据治理和AI知识,学习负担较重
  • 作为早期团队成员,需要应对模糊需求并推动跨部门协作
  • 适合具备扎实数据工程基础,对AI与数据平台交叉领域充满热情,且愿意长期成长的工程师

缺点 / 挑战

  • 平台建设涉及复杂数据处理,可能面临高难度问题排查和值班压力

角色解读

  • 可向数据平台架构师或技术负责人晋升,主导平台技术方向
  • 深入AI Native方向,成为数据代理、语义层等领域的专家
  • 拓展至MLOps/LLMOps,或与数据科学团队合作转向AI应用开发
  • 设计并维护数据管道,确保可扩展性和数据质量,涵盖实时与批量数据处理
  • 构建元数据管理、数据血缘和语义层,为自服务分析和自然语言查询提供基础
  • 实施数据治理和PII控制,并参与搭建监控和数据质量体系
  • 采用AI辅助开发,与Tech Lead和架构师协作,推动平台向智能数据代理演进
  • 扎实的Python和SQL能力,能编写生产级代码并执行单元/集成测试
  • 熟练使用Spark/PySpark进行大数据处理,掌握分区、性能优化
  • 熟悉实时数据接入(如Kafka)和批量管道编排(如Airflow、Kubeflow)
  • 理解数据建模、数据治理,并具备良好的软件工程实践

申请策略

  • 了解SAP的服务与支持场景,思考数据湖平台的业务价值
  • 准备1-2个能体现你解决复杂数据问题的故事,并量化影响
  • 强调Python、Spark、SQL项目实战,突出数据规模、性能优化和架构设计成果
  • 展示数据管道全生命周期案例,包括测试、监控和运维
  • 若有数据治理、PII处理或LLM应用经验,单独列出
  • 体现对代码质量和团队协作的重视,提及CI/CD实践
  • 熟悉Delta Lake、Elasticsearch、Kafka等工具,可搭建小型演示项目
  • 学习RAG、向量搜索、数据代理等AI数据平台概念,了解基本原理

面试指南

  • 使用STAR法组织回答,突出具体行动和量化结果
  • 展示系统性思考:从需求分析、架构设计到落地优化的完整链路
  • 强调权衡取舍和工程权衡,体现决策能力
  • 请介绍你设计过的一个复杂数据管道,如何保证数据质量和性能?
  • 你如何用Spark处理大规模数据?分享一次调优经历
  • 谈谈你对数据治理的理解,如何实现PII匿名化?
  • 如果让你构建一个支持AI应用的数据平台,你会如何设计?
  • 你如何看待AI代理在数据工程中的角色?

职位点评

77
综合评分

前沿技术栈,深度参与AI数据平台,薪资合理但WLB未明确。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合重视技术成长和职业发展,愿意投入学习新技术,对AI和数据平台交叉领域有热情的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展92
工作生活65
使命价值70

薪资福利

75中等

SAP作为大型外企,薪资福利有竞争力,但JD未披露具体数字。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

92较高

职位深度结合数据工程与AI代理技术,提供持续学习和成长机会,技术栈前沿。

技术前沿前沿/新兴技术
技术栈Python、Spark、SQL、PySpark、Kafka、Delta Lake、Elasticsearch、Airflow、Kubeflow、RAG、LLM、MLOps
成长机会Constant learning、skill growth、Technical Growth、Long-Term Vision、learning agility
业务类型cost_center

工作生活

65中等

SAP倡导灵活工作模式,但JD未明确具体远程政策,工作强度可能较大。

工作模式未明确
办公地点科技园/产业园
加班情况未提及(无法判断)
工作生活平衡flexible working models、health and well-being

使命价值

70中等

SAP使命是帮助世界更好地运转,该职位支持客户服务智能化,有一定社会价值。

行业发展稳定成熟行业
社会影响中性/一般
使命信号help the world run better、purpose-driven
创新程度积极采用新技术
Watch Jobs