Alibaba logo
阿里巴巴
千问事业部-大数据计算专家-杭州

千问事业部-大数据计算专家-杭州

发布于 大约 14 小时前

普通员工/个人贡献者

杭州市
专家级经验
全职员工
仅现场办公
本科
数据工程
Cpu
Daft
Gpu
Hudi
Lance
Orc
Paimon
Sql
分布式系统

AI 估算 · 45k–75k

阿里P7-P8级别专家岗,技术栈前沿,市场竞争激烈,薪资处于行业高位。

职位详情

关于这个职位

作为阿里巴巴千问事业部的大数据计算专家,您将负责设计并优化大规模多模态数据计算引擎,解决PB级数据处理中的性能瓶颈与稳定性挑战

您将主导从底层执行计划优化到上层开发者接口设计的全链路工作,并推动数据湖与AI原生格式的落地,是支撑公司AI与大数据业务的核心技术角色

最低要求

精通分布式系统原理,深入理解计算引擎(如 Spark、Flink、Ray、Daft等)的执行模型、任务调度、Shuffle 机制及容错设计

具备大规模数据处理系统的实战经验
熟悉 CPU/GPU 异构计算架构,具备在 GPU 加速数据处理(如视频解码、特征提取)、内存管理、向量化执行或算子融合等方向深度性能调优的实际项目经验
有构建开发者工具链或编程接口(SQL-like/Python SDK)的经验,关注用户体验,能够平衡系统能力与易用性,推动从本地调试到生产部署的端到端开发闭环
具备多租户资源隔离、内存/I/O 限流、优先级调度、反压控制等 QoS 保障机制的设计与落地经验,能有效应对流批一体场景下的稳定性挑战
熟悉数据湖技术栈(如 Paimon、Delta Lake、Iceberg、Hudi),了解对象存储、列式文件格式(Parquet、ORC 等)及新兴 AI 原生格式(如 Lance)、元数据管理及 ACID 事务机制
具备 AI/多模态数据处理(图像、音视频)Pipeline 构建经验

工作职责

负责大规模多模态数据计算引擎的核心架构设计与执行计划优化,构建面向异构计算(CPU/GPU)的高效任务调度机制与执行流水线,解决PB级多模态数据(图像、音频、视频等)处理过程中的关键性能瓶颈

应对PB级数据在Shuffle、Join、Aggregation等场景中面临的内存、I/O与存储资源挑战,攻克每日PB级流批一体数据处理过程中的系统稳定性难题
提供SQL-like与Python双端编程接口,打造从本地开发调试到生产级分布式计算的一站式开发体验,持续提升开发效率与工程易用性
应对百PB级结构化数据及多模态数据入湖场景下的高效存储与高吞吐I/O挑战
实现多租户I/O与存储资源的有效隔离
构建完善的数据治理体系,保障数据质量,防范数据腐化风险

优先资格

参与过开源大数据项目或在相关领域发表过技术论文者优先考虑

AI 洞察

优缺点分析

优点

  • 平台优势明显,阿里云及千问事业部资源丰富,技术影响力大
  • 薪资福利优厚,股票激励,职业发展空间大
  • 对综合能力要求高,需兼顾系统架构、性能优化与工程易用性

缺点 / 挑战

  • 技术挑战大,涉及PB级数据处理与AI多模态,能快速积累顶尖技术经验
  • 技术难度高,需精通分布式系统与异构计算,持续学习压力大
  • 工作强度大,可能面临高并发、大数据的稳定性压力
  • 适合对大数据计算引擎有深厚热情,具备专家级技术能力,并愿意在挑战中快速成长的资深工程师

角色解读

  • 在阿里云核心团队,可成长为大数据计算引擎的架构师或技术专家
  • 可向技术管理方向发展,带领团队负责更大规模的数据基础设施
  • 技术影响力可扩展至开源社区,成为行业知名的数据计算专家
  • 负责大规模多模态数据计算引擎的架构设计与执行计划优化,解决PB级数据处理性能瓶颈
  • 构建CPU/GPU异构计算的任务调度机制与执行流水线,提升数据处理效率
  • 开发SQL-like与Python双端编程接口,打造从本地开发到生产部署的一站式体验
  • 应对百PB级数据入湖的存储与I/O挑战,实现多租户资源隔离与数据治理
  • 精通分布式系统原理,深入理解Spark、Flink、Ray等计算引擎的执行模型与容错设计
  • 熟悉CPU/GPU异构计算,具备GPU加速数据处理和深度性能调优经验
  • 具备构建开发者工具链或编程接口的经验,关注用户体验
  • 熟悉数据湖技术栈(如Paimon、Iceberg)及AI原生格式,了解ACID事务机制

申请策略

  • 在简历中明确量化技术成果,如处理数据规模、性能提升倍数
  • 面试前了解千问事业部在AI大模型数据处理方面的技术挑战和方向
  • 突出在Spark/Flink/Ray等项目中的架构设计或核心模块开发经验
  • 强调GPU加速、性能调优的具体案例和量化成果(如性能提升百分比)
  • 展示构建开发者工具链或API的完整项目经历
  • 提及对数据湖、AI数据格式的深入理解或相关开源贡献
  • 深入学习Ray或Daft等新兴引擎的源码,理解其设计思想
  • 实践GPU编程(如CUDA)和向量化执行,提升性能调优能力

面试指南

  • 回答技术问题时,先阐述问题背景和挑战,再提出解决方案,最后量化结果
  • 对于架构设计问题,从需求分析、技术选型、实现细节到权衡取舍进行结构化回答
  • 结合项目经验,突出个人在其中的角色、贡献和思考过程
  • 如何优化Spark的Shuffle过程以处理PB级数据?
  • 描述一次你使用GPU加速数据处理Pipeline的经验,如何评估和优化性能?
  • 如何设计一个多租户环境下的资源隔离和QoS保障机制?
  • 你如何理解数据湖与AI原生数据格式(如Lance)的结合?
  • 在构建SQL-like或Python API时,如何平衡系统能力与易用性?

职位点评

76
综合评分

技术前沿、薪资优厚、成长空间大,但工作强度高、WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合追求技术深度和职业成长,能接受高强度工作节奏的资深技术专家。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活40
使命价值70

薪资福利

85较高

阿里巴巴作为上市巨头,提供有竞争力的薪酬和福利,薪资水平在行业中偏高,能较好满足补偿性动机。

薪资信号未披露(AI估算:45K-75K/月)

成长发展

95较高

该职位处于技术前沿,涉及AI多模态、异构计算等新兴领域,能提供极佳的技术成长和职业发展机会。

技术前沿前沿/新兴技术
技术栈Spark、Flink、Ray、Daft、GPU、CPU、Paimon、Delta Lake、Iceberg、Hudi、Lance、多模态
业务类型profit_center

工作生活

40较低

工作地点在杭州,需现场办公,且职位描述暗示高强度工作,生活化动机满足程度有限。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

职位服务于AI大模型基础设施,对推动技术发展有积极意义,但社会价值导向不直接。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs