
思爱普
Data Engineer
Data Engineer
发布于 大约 3 小时前普通员工/个人贡献者
上海市
中级经验
全职员工
混合式弹性办公
本科
数据工程
CI/CD
Pyspark
Sql
数据治理
AI 估算 · 25k–40k
上海外企数据工程师,3年以上核心技能,薪资处于市场中高水平。
职位详情
关于这个职位
本职位是SAP服务与支持数据湖团队的数据工程师,负责设计可扩展的数据管道、实时与批量数据接入、元数据和数据治理,并为AI服务提供数据支持
你将参与从孤立管道向统一智能平台的演进,推动自服务分析和自主数据代理的建设
适合具备Python、Spark和SQL经验,对数据治理和AI原生数据工程感兴趣的技术人才
最低要求
· 学士学位或同等实践经验
· 3年以上Python(pandas, pytest)和SQL编码经验
· 3年以上Spark/大数据处理经验(PySpark):转换、分区、性能优化
· 3年以上设计和部署数据管道经验,包括管理数据模式和处理高容量工作流
· 扎实的软件工程基础:干净代码、模块化设计、调试、版本控制和可维护文档
· 扎实的SQL和数据建模能力(规范化和反规范化模式、数据契约、模式演化)
· 实践测试和发布实践:单元/集成测试、CI/CD管道和安全生产发布
· 可观测性和运维经验:指标、日志、警报和友好的故障处理
· 有SQL数据库(优先PostgreSQL,其他可接受)和NoSQL数据库(必需Elasticsearch和Delta Lake)经验
· 有实时和批量接入经验(API - 轮询和推送、Kafka流)
· 有工作流编排经验(Kubeflow Pipelines、Airflow、Prefect或Dagster)
· 有数据治理经验:数据脱敏、匿名化和PII处理
· 熟练使用Git工作流:分支策略、代码审查、CI/CD集成
工作职责
· 设计和维护具有清晰架构和高质量标准的可扩展管道
· 构建来自不同来源的实时和批量接入,并自动验证
· 编写生产级代码,具备严格的测试纪律(单元/集成测试)、代码审查质量、可维护的模块化设计
· 端到端排查复杂数据问题,包括根本原因分析、性能瓶颈和可靠性事件
· 实施与治理要求一致的匿名化和PII控制
· 开发元数据管道,用于模式剖析、业务上下文提取和血缘追踪
· 为语义层做出贡献,将技术字段映射到业务术语,用于自服务和自然语言分析用例
· 使用AI辅助开发实践加速交付和维护
有自主代理经验更佳
· 建立监控、警报和数据质量控制,确保安全可靠的分析资产,基于数据科学要求评估其AI/ML就绪性
· 与Tech Lead和架构师合作,将需求转化为生产系统
优先资格
· 5年以上设计企业级数据平台和分析基础设施经验
· 熟悉LLM支持的数据应用,包括从数据平台角度的RAG、嵌入、向量搜索和评估
· 有构建支持AI相关应用和分析产品的数据服务和数据API经验
· 有生产化支持机器学习和智能应用的数据和特征管道经验
· 对AI原生数据工程和代理式数据工作流(包括编排、工具集成、评估和工作流自动化)有浓厚兴趣
· 了解MLOps/LLMOps原则,确保文本处理和脱敏管道的可扩展、可靠部署
· 有monorepo或共享库架构模式经验
· 能够在模糊性中操作并影响跨职能技术决策
· 具备采用新兴数据概念(例如数据代理和语义层模式)的学习敏捷性
AI 洞察
优缺点分析
优点
- 参与建设端到端智能数据平台,技术栈前沿,个人成长空间大
- 公司平台稳定,有完善的学习资源和内部流动机会
- 团队文化强调共享与质量,能培养严谨的工程习惯
- 接触AI代理、LLM等未来数据工程方向,职业前景广阔
- 需同时掌握数据工程、数据治理和AI知识,学习负担较重
- 作为早期团队成员,需要应对模糊需求并推动跨部门协作
- 适合具备扎实数据工程基础,对AI与数据平台交叉领域充满热情,且愿意长期成长的工程师
缺点 / 挑战
- 平台建设涉及复杂数据处理,可能面临高难度问题排查和值班压力
角色解读
- 可向数据平台架构师或技术负责人晋升,主导平台技术方向
- 深入AI Native方向,成为数据代理、语义层等领域的专家
- 拓展至MLOps/LLMOps,或与数据科学团队合作转向AI应用开发
- 设计并维护数据管道,确保可扩展性和数据质量,涵盖实时与批量数据处理
- 构建元数据管理、数据血缘和语义层,为自服务分析和自然语言查询提供基础
- 实施数据治理和PII控制,并参与搭建监控和数据质量体系
- 采用AI辅助开发,与Tech Lead和架构师协作,推动平台向智能数据代理演进
- 扎实的Python和SQL能力,能编写生产级代码并执行单元/集成测试
- 熟练使用Spark/PySpark进行大数据处理,掌握分区、性能优化
- 熟悉实时数据接入(如Kafka)和批量管道编排(如Airflow、Kubeflow)
- 理解数据建模、数据治理,并具备良好的软件工程实践
申请策略
- 了解SAP的服务与支持场景,思考数据湖平台的业务价值
- 准备1-2个能体现你解决复杂数据问题的故事,并量化影响
- 强调Python、Spark、SQL项目实战,突出数据规模、性能优化和架构设计成果
- 展示数据管道全生命周期案例,包括测试、监控和运维
- 若有数据治理、PII处理或LLM应用经验,单独列出
- 体现对代码质量和团队协作的重视,提及CI/CD实践
- 熟悉Delta Lake、Elasticsearch、Kafka等工具,可搭建小型演示项目
- 学习RAG、向量搜索、数据代理等AI数据平台概念,了解基本原理
面试指南
- 使用STAR法组织回答,突出具体行动和量化结果
- 展示系统性思考:从需求分析、架构设计到落地优化的完整链路
- 强调权衡取舍和工程权衡,体现决策能力
- 请介绍你设计过的一个复杂数据管道,如何保证数据质量和性能?
- 你如何用Spark处理大规模数据?分享一次调优经历
- 谈谈你对数据治理的理解,如何实现PII匿名化?
- 如果让你构建一个支持AI应用的数据平台,你会如何设计?
- 你如何看待AI代理在数据工程中的角色?
职位点评
77
综合评分
前沿技术栈,深度参与AI数据平台,薪资合理但WLB未明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合重视技术成长和职业发展,愿意投入学习新技术,对AI和数据平台交叉领域有热情的工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展92
工作生活65
使命价值70
薪资福利
75中等
SAP作为大型外企,薪资福利有竞争力,但JD未披露具体数字。
薪资信号未披露(AI估算:25K-40K/月)
成长发展
92较高
职位深度结合数据工程与AI代理技术,提供持续学习和成长机会,技术栈前沿。
技术前沿前沿/新兴技术
技术栈Python、Spark、SQL、PySpark、Kafka、Delta Lake、Elasticsearch、Airflow、Kubeflow、RAG、LLM、MLOps
成长机会Constant learning、skill growth、Technical Growth、Long-Term Vision、learning agility
业务类型cost_center
工作生活
65中等
SAP倡导灵活工作模式,但JD未明确具体远程政策,工作强度可能较大。
工作模式未明确
办公地点科技园/产业园
加班情况未提及(无法判断)
工作生活平衡flexible working models、health and well-being
使命价值
70中等
SAP使命是帮助世界更好地运转,该职位支持客户服务智能化,有一定社会价值。
行业发展稳定成熟行业
社会影响中性/一般
使命信号help the world run better、purpose-driven
创新程度积极采用新技术
思爱普 的其他在招职位
SAP China iXp Intern - Open Source Software Governance Tools Developer - Shanghai
思爱普 · 上海市AI 估算 · 4k-7kSAP China iXp Intern - Data Management Intern for GTLC Team - Shanghai
思爱普 · 上海市AI 估算 · 4k-6kSenior Account Executive - Auto
思爱普 · 北京市AI 估算 · 30k-55kSAP Taiwan iXp Intern - Marketing Intern
思爱普 · Taipei, TW, 11073AI 估算 · 5k-8kSAP China iXp Intern - Quality Engineer for Web Application - Xi'an
思爱普 · 西安市AI 估算 · 4k-7k
相似职位推荐
Watch Jobs