Alibaba logo
阿里巴巴
算法工程师-多模态基础大模型和多模态Agent

算法工程师-多模态基础大模型和多模态Agent

发布于 大约 14 小时前

实习/见习

北京市 / 杭州市
无经验要求
实习生
仅现场办公
学历未注明
机器学习工程
Pytorch
Tensorflow
分布式训练
多模态大模型
强化学习
数据挖掘
知识蒸馏
视觉编码器
预训练

AI 估算 · 6k–10k

阿里巴巴核心算法实习岗,薪资有竞争力,考虑实习待遇和城市生活成本,月薪约6000-10000元。

职位详情

关于这个职位

该职位是阿里巴巴核心算法团队的多模态大模型与Agent方向实习岗,你将直接参与Qwen核心模型研发,探索多模态基础模型和智能体的前沿技术,完成从算法研究、规模化训练到产品验证的完整闭环

适合对人工智能前沿技术有强烈兴趣、具备扎实深度学习基础的在读学生

最低要求

计算机视觉、人工智能、机器学习、自然语言、模式识别、计算机、数学等相关专业在读

熟练掌握tensorflow、pytorch等至少一种主流深度学习框架 -能够独立实现前沿模型,有大模型训练经验和基础大模型团队实习经验优先
良好的学术调研能力,良好的逻辑和数据分析能力,有高质量论文、开源项目、ACM竞赛经历、权威比赛获奖经历或落地项目产出者优先
有良好的自我学习能力及自驱力,对前沿领域有强探索欲和好奇心、善于独立思考并反思总结,具备良好的沟通能力和团队协作能力

工作职责

参与多模态基础模型核心算法研发,探索视觉与视频编码器、跨模态融合架构、动态分辨率、视觉Token压缩与Tokenization、多模态预训练与对齐、世界表征、后训练强化学习及知识蒸馏等前沿问题

探索面向数字世界与物理世界的多模态Agent新范式,研究多模态感知、推理、规划、记忆、工具调用和环境交互等关键能力,面向文档与Office、视频、Web与GUI、3D与空间智能以及行业场景,构建能够解决真实复杂任务的多模态Agent
大规模多模态数据研发: 建设面向大规模多模态数据研发预训练、后训练、Agent交互和强化学习的大规模数据体系,研究数据挖掘、清洗去重、质量评估、数据配比、合成数据、交互轨迹构造及高价值数据筛选等方法,持续提升训练数据的信息密度和模型能力上限
构建下一代多模态大模型与Agent评测体系,从真实业务流程和复杂用户任务中抽象评测场景,研究过程评测、Reward/Judge、任务成功率评估及模型失败分析方法,形成"评测发现问题—数据与算法迭代—真实场景验证"的研发闭环

优先资格

具有大模型预训练、后训练、RL、OPD或Agent研发经验

具有分布式训练、大规模数据处理或训练系统优化经验
在相关领域发表过高质量论文,或有具有影响力的开源项目
在ACM等算法竞赛、权威学术或行业比赛中取得突出成绩
主导或深度参与过有实际用户价值的模型、Agent或算法项目

AI 洞察

优缺点分析

优点

  • 直接参与Qwen核心模型研发,技术前沿性强,是AI领域最热门的多模态和Agent方向
  • 阿里巴巴平台资源丰富,数据、算力和业务场景齐全,能获得完整的技术闭环锻炼
  • 团队学术氛围浓厚,有机会接触顶尖论文和开源项目,提升个人技术影响力
  • 岗位要求高,需要扎实的深度学习和编程基础,对自驱力和学习能力要求高
  • 适合对AI前沿技术有强烈热情、理论基础扎实且具备优秀动手能力的在读学生,尤其是希望在大模型领域深度发展的求职者

缺点 / 挑战

  • 大模型训练和Agent研发难度大,工作压力可能较大,需要适应高强度研发节奏

角色解读

  • 从核心模型研发实习开始,积累多模态与Agent领域的前沿经验,可转正为正式算法工程师
  • 深入理解大规模预训练和强化学习全流程,逐步成长为技术专家或项目负责人
  • 依托阿里巴巴平台和Qwen生态,有机会参与开源项目并建立行业影响力
  • 参与多模态基础模型的核心算法研发,包括视觉编码器、跨模态融合、预训练与对齐等前沿方向
  • 探索多模态Agent的关键能力,如感知、推理、规划、工具调用,并构建解决真实任务的智能体
  • 建设大规模多模态数据体系,研究数据挖掘、清洗、合成、配比等方法
  • 构建评测体系,通过评测发现模型问题并驱动数据与算法迭代
  • 扎实的深度学习基础,熟练掌握PyTorch或TensorFlow至少一种框架
  • 具备大模型训练经验,熟悉分布式训练和数据处理
  • 良好的学术调研能力和数据分析能力,有论文、开源项目或竞赛经历优先
  • 自驱力强,对前沿技术有探索欲,善于独立思考和团队协作

申请策略

  • 阿里巴巴实习机会竞争激烈,建议提前准备一段深度技术分享或代码展示
  • 关注Qwen团队的技术博客和开源动态,在面试中展示你对团队工作的了解
  • 突出深度学习相关项目经验,尤其是大模型预训练、微调或Agent相关的实践
  • 强调熟练掌握PyTorch/TensorFlow,并展示自己能够独立实现模型的例子
  • 如果发表过论文或参与开源项目,务必详细说明你的贡献和成果
  • 如果有ACM竞赛获奖或权威比赛经历,要放在显眼位置
  • 建议提前学习多模态基础模型和强化学习相关知识,熟悉常见Transformer架构和训练技巧
  • 可以尝试阅读Qwen团队的开源代码和论文,理解现有模型的实现细节

面试指南

  • 回答项目经验时,可采用STAR法则,突出问题的背景、你的思考、具体行动和量化结果
  • 技术问题建议先说明概念,再结合具体场景举例,最后总结设计思路
  • 对于开放性问题,展示你的逻辑分析和知识迁移能力,不必追求标准答案
  • 请介绍一下你在多模态或大模型方面的项目经验?你是如何解决数据或训练中的挑战的?
  • 你对多模态模型中的视觉编码器有哪些理解?如何设计跨模态融合?
  • 你如何评估一个大模型的好坏?有哪些自动化评测方法?
  • 请解释一下强化学习在多模态Agent中的应用,你是如何设计奖励模型的?
  • 熟悉当前多模态大模型(如Qwen-VL、LLaVA等)的架构和训练方法

职位点评

71
综合评分

顶尖大厂核心算法实习,前沿技术栈,成长空间巨大,但工作强度未知,WLB不确定。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
适合追求前沿技术成长、希望在AI核心领域快速积累经验,并愿意承受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利55
成长发展88
工作生活50
使命价值85

薪资福利

55较低

该职位未明确薪资和福利,但阿里巴巴实习薪酬通常具有市场竞争力,可提供一定的经济保障。

薪资信号未披露(AI估算:6K-10K/月)

成长发展

88较高

职位直接参与核心模型研发,技术前沿性极强,能快速积累大模型和Agent经验,成长空间巨大。

技术前沿前沿/新兴技术
技术栈多模态基础模型、Agent、预训练、强化学习、知识蒸馏、PyTorch、TensorFlow、分布式训练
业务类型profit_center

工作生活

50较低

工作地点为北京、杭州、上海,未提及远程或弹性工作安排,且大厂核心算法岗通常有一定强度,WLB一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

85较高

多模态大模型和Agent是AI领域最具影响力的方向,研究成果有机会进入开源和实际业务场景,社会价值和行业前景突出。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度积极采用新技术
Watch Jobs