Alibaba logo
阿里巴巴
基础设施与稳定性工程-数据研发专家-AI算力数据与智能洞察方向

基础设施与稳定性工程-数据研发专家-AI算力数据与智能洞察方向

发布于 大约 2 小时前

普通员工/个人贡献者

杭州市
专家级经验
全职员工
仅现场办公
硕士
数据工程
Ai算力
Gpu
Odps
Sql
Tpm
容量规划
数据仓库
机器学习
运筹优化

AI 估算 · 40k–70k

阿里资深专家级岗位,AI算力方向核心,薪资竞争力强,参考市场水平。

职位详情

关于这个职位

该职位负责集团AI算力数据链路建设与智能洞察,包括构建TPM/GPU资源数据的采集、治理、建模和指标体系,以及开发容量规划、利用率优化算法,支撑MaaS业务增长和管理层决策

你将与核心团队合作,推动数据Agent化,实现算力资源的智能化管理
适合具备数据工程或算法背景,对AI基础设施有浓厚兴趣的资深工程师

最低要求

计算机/数学/统计相关专业本科或硕士及以上,硕士博士优先

数据工程:熟练掌握Flink/Spark/Hive/ODPS等,有完整数仓建设或数据治理经验,精通SQL
算法工程:具备ML/统计建模/运筹优化基础,有容量规划、资源调度或推荐优化项目经验,Python/Java工程能力扎实
了解AI/大模型业务、TPM/GPU算力/推理延迟等核心概念者优先
主导过大规模数据体系从0到1建设,或在算力资源调度、容量规划、供需匹配方向有突出成果
具备系统架构设计与独立方案落地能力
有AI Infra/云计算资源管理/LLM服务平台深度经验者优先
能牵引跨团队数据口径共识和联动

工作职责

方向一:AI算力数据链路建设(数据工程背景)

建设训练/推理(百炼、通义)两侧TPM与资源数据的采集、治理、建模和指标体系
设计标准化数仓,打通资源分配、交付、使用全链路数据口径
为MaaS经规管理、财务成本分析、BI、销控系统提供可信数据支撑
推动数据Agent化,让Agent可自动查询、分析和推理算力数据
方向二:算力智能洞察与优化模型(算法工程背景)
建立TPM容量规划模型与算力画像,支撑供需匹配和弹性交付智能决策
构建GPU/CPU/TPM利用率优化算法,实现全局卡型×模型最优匹配
开发智能流量管控与限流策略,保障运行时SLA(TTFT、TPOT、错误率)
结合Agent实现算力优化决策自动化执行闭环

优先资格

熟悉LLM推理/训练系统(vLLM、SGLang、Megatron等)

有Agent系统研发或LLM数据工具开发经验
资源调度/容量规划/运筹优化方向论文或开源贡献

AI 洞察

优缺点分析

优点

  • 处于AI算力核心领域,技术前沿,发展空间大
  • 团队核心,直接支撑业务决策,影响力大
  • 技术栈复杂,需同时掌握数据工程和算法,学习成本高
  • 工作强度可能较大,需要应对大规模数据和高并发场景
  • 跨团队协作要求高,需要较强的沟通和推动能力

缺点 / 挑战

  • 阿里巴巴平台资源丰富,数据规模大,挑战性强,能快速提升技术能力
  • 适合有深厚数据工程或算法背景,对AI基础设施有热情,喜欢挑战复杂问题的资深工程师

角色解读

  • 在AI基础设施领域深耕,成为算力数据方向的专家,主导集团级项目
  • 向技术管理方向发展,带领团队负责算力数据平台建设
  • 横向拓展至AI平台架构或云资源管理领域,成为复合型人才
  • 负责AI算力数据链路建设,包括数据采集、治理、建模和指标体系设计,确保数据准确性和一致性
  • 构建TPM容量规划模型和算力画像,优化资源调度和供需匹配,提升算力利用率
  • 开发智能流量管控和限流策略,保障推理服务的SLA,并推动数据Agent化,实现自动化决策
  • 精通数据工程工具(Flink/Spark/Hive/ODPS)和SQL,具备大规模数仓建设经验
  • 扎实的算法基础,熟悉机器学习、统计建模或运筹优化,有相关项目经验
  • 熟练掌握Python或Java,具备系统架构设计能力,能独立完成方案落地

申请策略

  • 了解阿里巴巴AI基础设施业务,如百炼、通义,在面试中展示对业务的理解
  • 准备项目案例,突出数据驱动决策和优化效果
  • 突出数仓建设或数据治理的完整项目经验,强调从0到1的成果
  • 强调算法项目经验,如容量规划、资源调度等,并量化成果
  • 展示对AI/大模型业务的理解,如TPM、GPU算力等概念
  • 提及系统架构设计能力和跨团队协作经验
  • 熟悉LLM推理系统(如vLLM、SGLang)和Agent开发框架
  • 补充运筹优化和资源调度相关知识,可参考相关论文

面试指南

  • 使用STAR法则:情境、任务、行动、结果,突出个人贡献和量化成果
  • 结合业务场景,强调数据驱动决策和实际影响
  • 展示系统思维,从数据采集到决策闭环的完整链路
  • 如何设计一个大规模数据仓库来支持算力资源管理?
  • 描述一个你主导的数据体系从0到1建设的项目,遇到哪些挑战?
  • 如何优化GPU利用率?请举例说明你的算法思路
  • 如何确保数据质量和一致性?
  • 你如何理解TPM、TTFT、TPOT?如何保障SLA?

职位点评

73
综合评分

阿里AI算力核心团队,技术前沿,发展空间大,但薪资面议,WLB不明。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和职业发展的资深工程师,对AI基础设施有热情,能接受现场办公和潜在加班。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值70

薪资福利

75中等

阿里巴巴提供有竞争力的薪酬和福利,但具体薪资未披露,需面议。

薪资信号面议 (40K-70K/月)

成长发展

90较高

该职位处于AI基础设施前沿,涉及数据工程和算法优化,技术成长空间大,且团队核心,发展前景好。

技术前沿前沿/新兴技术
技术栈Flink、Spark、Hive、ODPS、Python、Java、机器学习、运筹优化、LLM、Agent、GPU、TPM
业务类型profit_center

工作生活

50较低

工作地点在杭州,未提及远程或弹性办公,可能需现场办公,WLB信号不明。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI算力是当前热点,对行业有积极影响,但JD未强调社会价值,意义感一般。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs