
阿里巴巴
基础设施与稳定性工程-数据研发专家-AI算力数据与智能洞察方向
基础设施与稳定性工程-数据研发专家-AI算力数据与智能洞察方向
发布于 大约 2 小时前普通员工/个人贡献者
杭州市
专家级经验
全职员工
仅现场办公
硕士
数据工程
Ai算力
Gpu
Odps
Sql
Tpm
容量规划
数据仓库
机器学习
运筹优化
AI 估算 · 40k–70k
阿里资深专家级岗位,AI算力方向核心,薪资竞争力强,参考市场水平。
职位详情
关于这个职位
该职位负责集团AI算力数据链路建设与智能洞察,包括构建TPM/GPU资源数据的采集、治理、建模和指标体系,以及开发容量规划、利用率优化算法,支撑MaaS业务增长和管理层决策
你将与核心团队合作,推动数据Agent化,实现算力资源的智能化管理
适合具备数据工程或算法背景,对AI基础设施有浓厚兴趣的资深工程师
最低要求
计算机/数学/统计相关专业本科或硕士及以上,硕士博士优先
数据工程:熟练掌握Flink/Spark/Hive/ODPS等,有完整数仓建设或数据治理经验,精通SQL
算法工程:具备ML/统计建模/运筹优化基础,有容量规划、资源调度或推荐优化项目经验,Python/Java工程能力扎实
了解AI/大模型业务、TPM/GPU算力/推理延迟等核心概念者优先
主导过大规模数据体系从0到1建设,或在算力资源调度、容量规划、供需匹配方向有突出成果
具备系统架构设计与独立方案落地能力
有AI Infra/云计算资源管理/LLM服务平台深度经验者优先
能牵引跨团队数据口径共识和联动
工作职责
方向一:AI算力数据链路建设(数据工程背景)
建设训练/推理(百炼、通义)两侧TPM与资源数据的采集、治理、建模和指标体系
设计标准化数仓,打通资源分配、交付、使用全链路数据口径
为MaaS经规管理、财务成本分析、BI、销控系统提供可信数据支撑
推动数据Agent化,让Agent可自动查询、分析和推理算力数据
方向二:算力智能洞察与优化模型(算法工程背景)
建立TPM容量规划模型与算力画像,支撑供需匹配和弹性交付智能决策
构建GPU/CPU/TPM利用率优化算法,实现全局卡型×模型最优匹配
开发智能流量管控与限流策略,保障运行时SLA(TTFT、TPOT、错误率)
结合Agent实现算力优化决策自动化执行闭环
优先资格
熟悉LLM推理/训练系统(vLLM、SGLang、Megatron等)
有Agent系统研发或LLM数据工具开发经验
资源调度/容量规划/运筹优化方向论文或开源贡献
AI 洞察
优缺点分析
优点
- 处于AI算力核心领域,技术前沿,发展空间大
- 团队核心,直接支撑业务决策,影响力大
- 技术栈复杂,需同时掌握数据工程和算法,学习成本高
- 工作强度可能较大,需要应对大规模数据和高并发场景
- 跨团队协作要求高,需要较强的沟通和推动能力
缺点 / 挑战
- 阿里巴巴平台资源丰富,数据规模大,挑战性强,能快速提升技术能力
- 适合有深厚数据工程或算法背景,对AI基础设施有热情,喜欢挑战复杂问题的资深工程师
角色解读
- 在AI基础设施领域深耕,成为算力数据方向的专家,主导集团级项目
- 向技术管理方向发展,带领团队负责算力数据平台建设
- 横向拓展至AI平台架构或云资源管理领域,成为复合型人才
- 负责AI算力数据链路建设,包括数据采集、治理、建模和指标体系设计,确保数据准确性和一致性
- 构建TPM容量规划模型和算力画像,优化资源调度和供需匹配,提升算力利用率
- 开发智能流量管控和限流策略,保障推理服务的SLA,并推动数据Agent化,实现自动化决策
- 精通数据工程工具(Flink/Spark/Hive/ODPS)和SQL,具备大规模数仓建设经验
- 扎实的算法基础,熟悉机器学习、统计建模或运筹优化,有相关项目经验
- 熟练掌握Python或Java,具备系统架构设计能力,能独立完成方案落地
申请策略
- 了解阿里巴巴AI基础设施业务,如百炼、通义,在面试中展示对业务的理解
- 准备项目案例,突出数据驱动决策和优化效果
- 突出数仓建设或数据治理的完整项目经验,强调从0到1的成果
- 强调算法项目经验,如容量规划、资源调度等,并量化成果
- 展示对AI/大模型业务的理解,如TPM、GPU算力等概念
- 提及系统架构设计能力和跨团队协作经验
- 熟悉LLM推理系统(如vLLM、SGLang)和Agent开发框架
- 补充运筹优化和资源调度相关知识,可参考相关论文
面试指南
- 使用STAR法则:情境、任务、行动、结果,突出个人贡献和量化成果
- 结合业务场景,强调数据驱动决策和实际影响
- 展示系统思维,从数据采集到决策闭环的完整链路
- 如何设计一个大规模数据仓库来支持算力资源管理?
- 描述一个你主导的数据体系从0到1建设的项目,遇到哪些挑战?
- 如何优化GPU利用率?请举例说明你的算法思路
- 如何确保数据质量和一致性?
- 你如何理解TPM、TTFT、TPOT?如何保障SLA?
职位点评
73
综合评分
阿里AI算力核心团队,技术前沿,发展空间大,但薪资面议,WLB不明。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和职业发展的资深工程师,对AI基础设施有热情,能接受现场办公和潜在加班。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值70
薪资福利
75中等
阿里巴巴提供有竞争力的薪酬和福利,但具体薪资未披露,需面议。
薪资信号面议 (40K-70K/月)
成长发展
90较高
该职位处于AI基础设施前沿,涉及数据工程和算法优化,技术成长空间大,且团队核心,发展前景好。
技术前沿前沿/新兴技术
技术栈Flink、Spark、Hive、ODPS、Python、Java、机器学习、运筹优化、LLM、Agent、GPU、TPM
业务类型profit_center
工作生活
50较低
工作地点在杭州,未提及远程或弹性办公,可能需现场办公,WLB信号不明。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI算力是当前热点,对行业有积极影响,但JD未强调社会价值,意义感一般。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs