Alibaba logo
阿里巴巴
研究型实习生-AI算力数据与Agent研发工程师

研究型实习生-AI算力数据与Agent研发工程师

发布于 大约 4 小时前

实习/见习

杭州市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Ai算力
Cuda
Rlhf
Sglang
Vllm
分布式系统
多智能体
性能优化
推理引擎

AI 估算 · 6k–12k

阿里研究型实习,薪资在同类中处于中等水平,但技术含量高,有助于快速成长。

职位详情

关于这个职位

这是阿里巴巴的研究型实习生岗位,聚焦AI算力数据层与Agent系统的研发

你将参与构建大规模算力管理模型、开发智能体用于容量规划、资源调度和性能优化,并研究多智能体协作框架
适合对AI基础设施、系统架构和前沿算法有浓厚兴趣的博士或优秀硕士生

最低要求

计算机系统、人工智能、运筹统计与最优化理论、控制学相关领域博士研究生,或特别突出的硕士研究生,可连续实习6个月以上

前沿技术研究:跟进AI/Agent基础设施与系统架构、模型算法领域的最新SOTA研究成果,在资源管理与调度、系统/引擎架构与性能优化、模型结构等领域有突出成果,并在国际高水平的系统、算法顶会有学术论文发表
领域背景:深入理解 MaaS推理平台、Agent系统、推理引擎、模型训练(至少精通其一),对资源算力管理、AI Infra集群管理与调度、AI系统架构优化、AI模型训练与结构优化有较突出工作经验(至少其一)
推理与Agent优化方向:具备推理引擎与Agent多智能体系统研发背景,具备强系统架构与工程能力,熟悉Harness工程如任务规划、工具调用、反思优化、分布式协、RAG/向量检索,及常见Agent框架如LangChain/LangGraph/AutoGen/CrewAI/Codex CLI,训练推理引擎框架如vLLM/SGLang/Megatron/OpenRLHF/Pytorch/TensorRT等
有开源项目代码贡献和相关项目经验者优先
模型训练优化方向:具备LLM、多模态、世界模型等模型研发背景,熟悉业界大模型结构、后训练方法,精通算法研发、训练数据管线构建、模型自动评测
具备SFT、后训练RLHF/RLAIF/RLVF、RL DPO/PPO/GRPO 等一种或多种方法或算法实践经验,围绕业务目标构建训练数据集、奖励机制与评测体系
优化方向:擅长利用数智驱动方式进行算力资源管理优化、全局最优匹配、模型运行时优化、各类引擎架构系统优化、软硬结合的优化等

工作职责

建设AI算力池数据层,构建各类资源算力管理模型,研发Agent生产系统,与AI算力池的训推平台SRE各系统Agent联动,实现端到端自动化的TPM智能容量规划、弹性交付、需求应答、智能流量管控调度、自适应限流、资源高效流转腾挪,实现全局TPM利用率、单位算力Token成本的优化

建设单机和中心的管控Agent,实现模型的TPM运行时算力质量与性能自适应优化与SLA保障,解决模型部署运行时GPU/CPU/kv显存内存/PCIe互联/网络通信在通用与Scalup机型架构下的各类竞争与干扰,Agent具备端到端的问题识别发现、根因诊断、算力与性能优化、后训练Agentic RL反馈微调垂类模型等自动化闭环,增强Agent对模型运行时算力问题、性能瓶颈和优化策略的理解,自动识别并完成差异化硬件芯片架构、集群/网络/互联架构、系统软件栈如内核/编译下的软硬件结合优化、全局卡型模型最优匹配
构建引擎架构与性能优化Agent,通过各类系统架构与性能优化,实现TPM性能与计算效率、各类模型与Agent能力体验大幅优化
典型如Agent自动优化推理引擎架构代码、训练系统架构代码、模型结构、AIData管线架构代码、Agent Infra架构代码、Agentic RL训推联动系统架构代码等
搭建多智能体协作框架,研究数十万智能体Agent的分工、协同、通信机制、后训练、反思与决策机制,提升各Agent系统在复杂场景下的鲁棒性、稳定性、执行效率与优化效果

优先资格

加分技术领域背景:AI for System for AI背景,在超算、分布式系统、资源管理与调度、大模型训推研发、模型结构与模型网络架构设计(文本/多模态/世界模型)

熟悉CUDA、PTX等编译优化技术、GPU/TPU/NPU/各类CPU芯片软硬件架构栈等优先

AI 洞察

优缺点分析

优点

  • 阿里巴巴平台资源丰富,有大量真实业务场景和GPU资源支持研究
  • 与顶尖系统工程师和研究员合作,学术和工程能力双提升
  • 实习薪资竞争力强,并有机会获得转正offer
  • 研究内容涉及多个复杂领域,需要较强系统设计和工程实现能力
  • 对学术要求高,需要有顶会论文发表或相关研究经验
  • 适合对AI基础设施、系统性能优化和智能体技术有浓厚兴趣,具备扎实系统能力和研究志业的博士生或优秀硕士生

缺点 / 挑战

  • 接触最前沿的AI算力和Agent技术,技术挑战大,成长迅速
  • 工作强度可能较高,需要应对高并发和性能优化的压力

角色解读

  • 在阿里AI Infra团队积累大规模算力管理和Agent系统研发经验,成为行业专家
  • 可继续深耕AI for System方向,向技术专家或架构师发展
  • 优秀实习生可获得转正机会,正式加入阿里巴巴或进入顶尖AI团队
  • 建设AI算力池数据层,开发资源算力管理模型和Agent生产系统
  • 与SRE系统联动,实现TPM智能容量规划、弹性交付和流量调度
  • 研发单机和中心管控Agent,实现模型运行时性能自适应优化和SLA保障
  • 构建多智能体协作框架,研究数十万Agent的分工协同与决策机制
  • 精通至少一种主流深度学习框架(如PyTorch)和推理引擎(如vLLM/SGLang)
  • 熟悉Agent框架(LangChain/LangGraph等)和多智能体协作机制
  • 具备系统架构设计能力,熟悉分布式系统、资源调度和GPU编程优化
  • 掌握模型后训练方法(RLHF/DPO等)和数据管线构建

申请策略

  • 了解阿里AI基础设施部门工作,在面试中展现对算力优化和Agent技术的热情
  • 准备好展示自己做过的深度项目或研究,体现实际能力
  • 突出在系统/引擎架构、资源调度或模型训练方面的研究和工程实践
  • 展示开源项目贡献或在顶会发表的学术论文,特别是与AI Infra相关
  • 强调熟悉vLLM、LangChain等工具链和CUDA等底层优化的经验
  • 体现解决复杂系统问题的能力和参与大型项目的经历
  • 提前熟悉主流Agent框架和推理引擎,阅读相关源码
  • 补充分布式系统、资源管理和GPU编程知识

面试指南

  • 按照'问题定义-方案设计-实现细节-效果评估'的结构回答,突出系统思维和数据驱动
  • 结合项目经验,量化收益,展示对底层原理的理解
  • 强调与团队合作和技术选型的权衡
  • 如何设计一个Agent系统来自动优化推理引擎的TPM性能?
  • 在资源调度中,如何平衡延迟和成本?
  • 请讲一个你优化过的分布式训练或推理系统的案例
  • 多智能体协作中如何处理通信开销和一致性?
  • 你如何跟进最新的SOTA研究并应用到实际系统?

职位点评

65
综合评分

阿里前沿AI Infra实习,技术成长极佳,但WLB一般,薪资中等。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
适合追求技术突破和职业成长、不介意高强度工作的研究型学生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利50
成长发展95
工作生活40
使命价值75

薪资福利

50较低

实习薪资处于市场中等水平,但作为大厂实习生福利相对完善,稳定性高。

薪资信号未披露(AI估算:6K-12K/月)

成长发展

95较高

该职位处于AI Infra和Agent技术前沿,能获得顶尖的工程和研究训练,技能提升显著。

技术前沿前沿/新兴技术
技术栈AI算力、Agent、vLLM、SGLang、CUDA、LangChain、多智能体、RLHF、分布式系统、性能优化
成长机会前沿技术研究、学术论文发表、自动化闭环
业务类型cost_center

工作生活

40较低

岗位要求现场办公,且研究性强可能需要投入大量时间,工作生活平衡一般。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

75中等

AI算力基础设施是推动AI发展的核心,具有较高行业价值,但岗位偏底层技术,直接社会影响有限。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs