
阿里巴巴
研究型实习生-AI算力数据与Agent研发工程师
研究型实习生-AI算力数据与Agent研发工程师
发布于 大约 4 小时前实习/见习
杭州市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Ai算力
Cuda
Rlhf
Sglang
Vllm
分布式系统
多智能体
性能优化
推理引擎
AI 估算 · 6k–12k
阿里研究型实习,薪资在同类中处于中等水平,但技术含量高,有助于快速成长。
职位详情
关于这个职位
这是阿里巴巴的研究型实习生岗位,聚焦AI算力数据层与Agent系统的研发
你将参与构建大规模算力管理模型、开发智能体用于容量规划、资源调度和性能优化,并研究多智能体协作框架
适合对AI基础设施、系统架构和前沿算法有浓厚兴趣的博士或优秀硕士生
最低要求
计算机系统、人工智能、运筹统计与最优化理论、控制学相关领域博士研究生,或特别突出的硕士研究生,可连续实习6个月以上
前沿技术研究:跟进AI/Agent基础设施与系统架构、模型算法领域的最新SOTA研究成果,在资源管理与调度、系统/引擎架构与性能优化、模型结构等领域有突出成果,并在国际高水平的系统、算法顶会有学术论文发表
领域背景:深入理解 MaaS推理平台、Agent系统、推理引擎、模型训练(至少精通其一),对资源算力管理、AI Infra集群管理与调度、AI系统架构优化、AI模型训练与结构优化有较突出工作经验(至少其一)
推理与Agent优化方向:具备推理引擎与Agent多智能体系统研发背景,具备强系统架构与工程能力,熟悉Harness工程如任务规划、工具调用、反思优化、分布式协、RAG/向量检索,及常见Agent框架如LangChain/LangGraph/AutoGen/CrewAI/Codex CLI,训练推理引擎框架如vLLM/SGLang/Megatron/OpenRLHF/Pytorch/TensorRT等
有开源项目代码贡献和相关项目经验者优先
模型训练优化方向:具备LLM、多模态、世界模型等模型研发背景,熟悉业界大模型结构、后训练方法,精通算法研发、训练数据管线构建、模型自动评测
具备SFT、后训练RLHF/RLAIF/RLVF、RL DPO/PPO/GRPO 等一种或多种方法或算法实践经验,围绕业务目标构建训练数据集、奖励机制与评测体系
优化方向:擅长利用数智驱动方式进行算力资源管理优化、全局最优匹配、模型运行时优化、各类引擎架构系统优化、软硬结合的优化等
工作职责
建设AI算力池数据层,构建各类资源算力管理模型,研发Agent生产系统,与AI算力池的训推平台SRE各系统Agent联动,实现端到端自动化的TPM智能容量规划、弹性交付、需求应答、智能流量管控调度、自适应限流、资源高效流转腾挪,实现全局TPM利用率、单位算力Token成本的优化
建设单机和中心的管控Agent,实现模型的TPM运行时算力质量与性能自适应优化与SLA保障,解决模型部署运行时GPU/CPU/kv显存内存/PCIe互联/网络通信在通用与Scalup机型架构下的各类竞争与干扰,Agent具备端到端的问题识别发现、根因诊断、算力与性能优化、后训练Agentic RL反馈微调垂类模型等自动化闭环,增强Agent对模型运行时算力问题、性能瓶颈和优化策略的理解,自动识别并完成差异化硬件芯片架构、集群/网络/互联架构、系统软件栈如内核/编译下的软硬件结合优化、全局卡型模型最优匹配
构建引擎架构与性能优化Agent,通过各类系统架构与性能优化,实现TPM性能与计算效率、各类模型与Agent能力体验大幅优化
典型如Agent自动优化推理引擎架构代码、训练系统架构代码、模型结构、AIData管线架构代码、Agent Infra架构代码、Agentic RL训推联动系统架构代码等
搭建多智能体协作框架,研究数十万智能体Agent的分工、协同、通信机制、后训练、反思与决策机制,提升各Agent系统在复杂场景下的鲁棒性、稳定性、执行效率与优化效果
优先资格
加分技术领域背景:AI for System for AI背景,在超算、分布式系统、资源管理与调度、大模型训推研发、模型结构与模型网络架构设计(文本/多模态/世界模型)
熟悉CUDA、PTX等编译优化技术、GPU/TPU/NPU/各类CPU芯片软硬件架构栈等优先
AI 洞察
优缺点分析
优点
- 阿里巴巴平台资源丰富,有大量真实业务场景和GPU资源支持研究
- 与顶尖系统工程师和研究员合作,学术和工程能力双提升
- 实习薪资竞争力强,并有机会获得转正offer
- 研究内容涉及多个复杂领域,需要较强系统设计和工程实现能力
- 对学术要求高,需要有顶会论文发表或相关研究经验
- 适合对AI基础设施、系统性能优化和智能体技术有浓厚兴趣,具备扎实系统能力和研究志业的博士生或优秀硕士生
缺点 / 挑战
- 接触最前沿的AI算力和Agent技术,技术挑战大,成长迅速
- 工作强度可能较高,需要应对高并发和性能优化的压力
角色解读
- 在阿里AI Infra团队积累大规模算力管理和Agent系统研发经验,成为行业专家
- 可继续深耕AI for System方向,向技术专家或架构师发展
- 优秀实习生可获得转正机会,正式加入阿里巴巴或进入顶尖AI团队
- 建设AI算力池数据层,开发资源算力管理模型和Agent生产系统
- 与SRE系统联动,实现TPM智能容量规划、弹性交付和流量调度
- 研发单机和中心管控Agent,实现模型运行时性能自适应优化和SLA保障
- 构建多智能体协作框架,研究数十万Agent的分工协同与决策机制
- 精通至少一种主流深度学习框架(如PyTorch)和推理引擎(如vLLM/SGLang)
- 熟悉Agent框架(LangChain/LangGraph等)和多智能体协作机制
- 具备系统架构设计能力,熟悉分布式系统、资源调度和GPU编程优化
- 掌握模型后训练方法(RLHF/DPO等)和数据管线构建
申请策略
- 了解阿里AI基础设施部门工作,在面试中展现对算力优化和Agent技术的热情
- 准备好展示自己做过的深度项目或研究,体现实际能力
- 突出在系统/引擎架构、资源调度或模型训练方面的研究和工程实践
- 展示开源项目贡献或在顶会发表的学术论文,特别是与AI Infra相关
- 强调熟悉vLLM、LangChain等工具链和CUDA等底层优化的经验
- 体现解决复杂系统问题的能力和参与大型项目的经历
- 提前熟悉主流Agent框架和推理引擎,阅读相关源码
- 补充分布式系统、资源管理和GPU编程知识
面试指南
- 按照'问题定义-方案设计-实现细节-效果评估'的结构回答,突出系统思维和数据驱动
- 结合项目经验,量化收益,展示对底层原理的理解
- 强调与团队合作和技术选型的权衡
- 如何设计一个Agent系统来自动优化推理引擎的TPM性能?
- 在资源调度中,如何平衡延迟和成本?
- 请讲一个你优化过的分布式训练或推理系统的案例
- 多智能体协作中如何处理通信开销和一致性?
- 你如何跟进最新的SOTA研究并应用到实际系统?
职位点评
65
综合评分
阿里前沿AI Infra实习,技术成长极佳,但WLB一般,薪资中等。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
适合追求技术突破和职业成长、不介意高强度工作的研究型学生。
表现最好
成长发展
相对薄弱
工作生活
薪资福利50
成长发展95
工作生活40
使命价值75
薪资福利
50较低
实习薪资处于市场中等水平,但作为大厂实习生福利相对完善,稳定性高。
薪资信号未披露(AI估算:6K-12K/月)
成长发展
95较高
该职位处于AI Infra和Agent技术前沿,能获得顶尖的工程和研究训练,技能提升显著。
技术前沿前沿/新兴技术
技术栈AI算力、Agent、vLLM、SGLang、CUDA、LangChain、多智能体、RLHF、分布式系统、性能优化
成长机会前沿技术研究、学术论文发表、自动化闭环
业务类型cost_center
工作生活
40较低
岗位要求现场办公,且研究性强可能需要投入大量时间,工作生活平衡一般。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
75中等
AI算力基础设施是推动AI发展的核心,具有较高行业价值,但岗位偏底层技术,直接社会影响有限。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs