
阿里巴巴
面向大模型推理的通用后端运行时系统研究-阿里星/A Star
面向大模型推理的通用后端运行时系统研究-阿里星/A Star
发布于 大约 4 小时前普通员工/个人贡献者
北京市
无经验要求
全职员工
仅现场办公
学历未注明
平台工程
Criu
Cuda
Gpu编程
Linux内核
Rdma
Sglang
Vllm
大模型推理
系统架构
AI 估算 · 35k–50k
阿里星为阿里顶尖校招项目,薪资竞争力强,大模型系统方向人才稀缺。
职位详情
关于这个职位
这是一个面向大模型推理场景的底层系统研发岗位,主要研究并优化推理进程的运行时系统,涉及Linux内核、GPU资源和高效快照恢复技术
作为阿里星(A Star)项目,你将参与构建引擎无关的推理后端,支撑阿里云百炼平台的大模型服务
适合对系统软件、高性能计算和AI基础设施有浓厚兴趣的顶尖学子
最低要求
届毕业生,计算机科学、软件工程或相关专业,研究方向涉及操作系统、高性能计算或AI基础设施
扎实的系统编程能力,精通C/C++,对Linux内核机制(进程管理、内存管理、cgroup/namespace)有深入理解
熟悉以下至少一项:进程checkpoint/restore(如CRIU)、GPU编程与CUDA Runtime内部机制、容器/虚拟化技术、高性能I/O(RDMA/DMA/PCIe)、推理框架(如SGLang)、kvcache(如Mooncake)
工作职责
负责面向大模型推理场景的通用后端运行时系统研究与架构设计,核心目标是构建引擎无关的系统层,统一管理推理进程状态、模型权重生命周期与GPU设备资源
研究并优化推理进程的高效快照与恢复机制,在Linux CRIU基础上针对GPU推理进程进行深度定制,推动关键路径逼近PCIe/RDMA硬件带宽极限
设计模型权重的跨进程、跨实例共享机制,支撑多模型混部、热升级、弹性扩缩容等生产场景下的零拷贝权重复用
与百炼推理平台团队紧密协作,将后端运行时能力落地到模型上下线、故障恢复、跨可用区调度等真实业务链路,形成可量化的成本与弹性收益
优先资格
在OSDI/SOSP/EuroSys/ATC/ASPLOS/NSDI等系统顶会有论文发表
有CRIU、Linux内核、GPU驱动或虚拟化相关的开源贡献经验
熟悉LLM推理系统架构(vLLM/SGLang/TRT-LLM),理解推理进程的运行时行为特征
有GPU显存管理、CUDA VMM、Multi-Process Service等GPU系统层面的研发经验
AI 洞察
优缺点分析
优点
- 加入阿里星尖子项目,获得顶级平台和资源支持,薪酬福利行业领先
- 从事大模型基础设施前沿领域,技术壁垒高,积累可迁移的系统能力
- 与百炼平台等核心业务结合,技术影响力直接作用于生产环境
- 技术难度极高,涉及内核、GPU、分布式系统,需要较强的自学和攻坚能力
- 研究型岗位对理论深度和工程落地都有要求,需平衡两者
缺点 / 挑战
- 工作强度可能较大,阿里文化节奏快,需要适应高压力环境
- 适合对底层系统技术有强烈兴趣、追求技术巅峰、能承受高强度挑战的顶尖计算机相关专业毕业生
角色解读
- 成长为AI基础设施领域的系统架构专家,主导下一代推理运行时设计
- 可向技术专家或技术管理方向发展,参与阿里云核心基础设施决策
- 有机会与顶级研究团队合作,发表系统顶会论文,提升行业影响力
- 负责设计并实现大模型推理的后端运行时系统,统一管理GPU资源、模型权重和推理进程状态
- 基于CRIU等机制开发GPU推理进程的快速快照与恢复,优化关键路径性能
- 设计跨进程/实例的权重共享机制,支持多模型混部、热升级和弹性伸缩
- 与推理平台团队协作,将运行时能力落地到生产环境,实现成本与弹性优化
- 精通C/C++,深入理解Linux内核(进程、内存、cgroup/namespace)
- 具备系统级开发经验,熟悉CRIU、CUDA、容器、RDMA等至少一项技术
- 了解大模型推理框架(如SGLang、vLLM)或GPU显存管理更佳
- 有相关研究经历或开源贡献者优势明显
申请策略
- 提前了解阿里巴巴百炼平台业务场景,思考运行时优化的实际痛点
- 面试中强调研究深度和工程能力,展示解决复杂系统问题的思路
- 突出系统编程项目经验,如自研内核模块、进程迁移、GPU优化等
- 强调论文发表或开源贡献,尤其是系统领域顶会或CRIU/Linux内核相关
- 展示对LLM推理系统的理解,如分析vLLM/SGLang的运行时瓶颈
- 量化成果:性能提升、资源节省等数据更有说服力
- 补强Linux内核与CRIU知识,动手实践进程快照恢复
- 学习CUDA编程和GPU显存管理,了解MPS、VMM机制
面试指南
- 从问题拆解、技术选型、实现细节、性能评估四步回答
- 结合具体项目经验,突出对底层机制的理解,避免空谈
- 如果没有直接经验,可阐述类似技术原理,展现快速学习能力
- 请详细说明你如何实现一个进程的checkpoint/restore?涉及哪些内核机制?
- 如果GPU推理进程需要热迁移,你会如何设计?
- 如何优化大模型权重的加载和共享?有什么方案?
- 你如何理解CUDA VMM和MPS?它们在多进程场景下有什么作用?
- 描述一个你深入研究过的系统问题,以及你的解决过程
职位点评
81
综合评分
阿里星顶尖AI系统岗,技术极前沿薪资优厚,但节奏快压力大。
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合追求技术前沿、渴望快速成长并能接受高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展95
工作生活50
使命价值85
薪资福利
85较高
阿里星作为顶级校招项目,薪资和福利具有很强竞争力,但JD未具体披露。
薪资信号未披露(AI估算:35K-50K/月)
成长发展
95较高
岗位涉及前沿大模型系统研究,提供深厚的技能成长空间和顶会发表机会。
技术前沿前沿/新兴技术
技术栈C++、Linux内核、CRIU、GPU、CUDA、RDMA、大模型推理、SGLang、vLLM
业务类型ambiguous
工作生活
50较低
未明确WLB,现场办公,通常互联网大厂节奏较快,生活平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
85较高
大模型基础设施推动AI发展,具有较高的技术使命感和社会价值。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度开拓性创新(行业首创)
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs