Alibaba logo
阿里巴巴
千问事业部-大模型训推平台开发工程师-广州/杭州

千问事业部-大模型训推平台开发工程师-广州/杭州

发布于 大约 8 小时前

普通员工/个人贡献者

杭州市 / 广州市
中级经验
全职员工
仅现场办公
本科
平台工程
分布式系统
多模态
大模型
推理部署
模型优化
训推平台
资源调度

AI 估算 · 20k–40k

大厂平台,技术前沿,岗位需求大,薪资竞争力强,一线城市水平。

职位详情

关于这个职位

你将加入阿里巴巴千问事业部,负责大模型训推平台的架构设计与开发,支持从模型训练到推理部署的全生命周期

与算法和引擎团队紧密协作,构建超大规模计算资源管理和优化能力,推动多模态、Agentic训推体系落地
这是一个技术挑战大、成长空间广阔的岗位,适合对大模型基础设施充满热情的工程师

最低要求

计算机、人工智能或相关专业本科及以上学历

具备扎实的编程能力,熟练掌握Java开发,熟悉Python、Shell等脚本语言
对大模型领域的技术充满热情
具备解决复杂需求和技术研究的能力,善于进行需求分解和技术创新,擅长团队沟通与协作

工作职责

负责大模型训推平台的架构设计与开发,支持业务在模型开发、训练、评估、优化、推理部署等全生命周期的需求,确保平台的高可用性和可扩展性

与算法、训推引擎团队紧密合作,构建超大规模计算/存储资源管理,面向多模态、Agentic的训推体系能力
优化大模型训练效率和稳定性,建设数据可观测性、效果&服务稳定性保障和排查机制、资源任务调度优化能力
支持训推结合和模型优化,结合MTP、QAT、蒸馏技术、以及自动化评估系统,构建高性能和精度保障的模型压缩优化能力

优先资格

具有大型项目/系统的负责人经历者优先考虑

在大模型训练及优化方面有相关经验者优先

AI 洞察

优缺点分析

优点

  • 阿里巴巴千问事业部是大模型核心团队,技术影响力大,业务前景广阔
  • 解决的是业界前沿的训推平台问题,涉及超大规模分布式计算、模型压缩优化等,技术含金量高
  • 平台开发涉及面广,能积累多集群调度、高可用架构等宝贵经验
  • 大模型技术迭代极快,需要持续学习,保持技术最新状态
  • 平台稳定性和效率要求高,工作强度可能较大,需要较强的抗压能力
  • 需与算法、引擎、业务等多方紧密协作,沟通成本高,需要综合能力

缺点 / 挑战

  • 适合对大模型基础设施充满热情、有分布式系统或平台开发经验,喜欢技术挑战并愿意在阿里快速成长的工程师

角色解读

  • 从工程师成长为技术专家,深挖大模型训推平台底层技术
  • 可沿阿里技术专家或架构师路径发展,系统架构能力和技术影响力是主要提升方向
  • 大模型行业发展迅速,平台开发人才需求旺盛,未来甚至可以转向AI基础架构研究或内部创业
  • 负责大模型训推平台的架构设计与开发,支撑模型开发、训练、评估、优化、推理部署全生命周期
  • 与算法和训推引擎团队协作,构建超大规模计算/存储资源管理,打造面向多模态、Agentic的训推体系
  • 优化训练效率和稳定性,建设数据可观测性、稳定性保障和资源任务调度优化能力
  • 结合MTP、QAT、蒸馏等前沿技术,实现高性能和精度保障的模型压缩优化
  • 扎实的Java开发能力,熟悉Python、Shell等脚本语言,具备大型项目经验
  • 理解大模型训练和推理框架(如PyTorch、DeepSpeed等),有分布式系统设计经验
  • 熟悉资源调度、容器化、Kubernetes等平台基础设施技术
  • 具备复杂系统设计、性能优化与故障排查能力,同时要有良好的团队沟通协作能力

申请策略

  • 了解阿里千问事业部的大模型产品和技术方向,在面试中展现对业务的思考
  • 准备深度系统设计问题,如分布式训练平台架构、容错机制等
  • 重点突出Java/分布式系统的项目经历,尤其是参与过大规模系统设计或故障处理的经验
  • 如有大模型训练/推理优化相关经验,必须详细描述,这是加分项
  • 体现解决复杂问题的案例,比如性能调优、资源调度优化等,并量化结果
  • 提前学习大模型训练/推理框架的基本原理,理解平台层面的需求
  • 熟悉Kubernetes、容器调度、分布式计算等平台核心技术
  • 加强Java编程和性能调优能力,巩固操作系统、网络等底层知识

面试指南

  • 系统设计题从需求分析、架构选型、关键模块(调度、存储、容错)和演进路线结构化回答
  • 结合具体项目例子,说明背景、你的方案、结果和复盘,尽量量化
  • 展现对大模型领域的热情和持续学习能力,可提及自己尝试过的相关项目或实验
  • 如何设计一个支持多租户的资源弹性调度的大规模分布式训练平台?
  • 如何优化多机多卡训练中的显存和通信效率?
  • 描述一次你排查线上分布式系统故障并解决的过程
  • 大模型训练平台有哪些关键技术挑战?你如何应对?
  • 复习分布式一致性、资源调度、网络通信等基础知识

职位点评

78
综合评分

大厂核心AI赛道,技术前沿成长快,薪资优厚但工作强度需评估。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术前沿、渴望在大模型平台方向深耕、能接受高强度工作并享受创新挑战的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活50
使命价值80

薪资福利

85较高

阿里巴巴品牌和平台能提供有竞争力的薪资报酬和完善的福利体系,待遇在行业内处于领先水平。

薪资信号未披露(AI估算:20K-40K/月)

成长发展

90较高

该职位处于大模型技术最前沿,涉及分布式平台、模型优化等热门技术,技术成长空间大,职业发展前景广阔。

技术前沿前沿/新兴技术
技术栈Java、Python、分布式系统、大模型、资源调度、模型优化、MTP、QAT
业务类型ambiguous

工作生活

50较低

阿里巴巴工作节奏相对较快,但对WLB的保障并未在JD中明确说明,具体情况可能更看团队实际氛围。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

该岗位参与构建大模型基础设施,推动AI前沿技术落地,社会价值和技术使命感受到认可。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs