Alibaba logo
阿里巴巴
研究型实习生-面向多领域任务泛化的GUI Agent多轮强化学习方法研究

研究型实习生-面向多领域任务泛化的GUI Agent多轮强化学习方法研究

发布于 大约 3 小时前

实习/见习

杭州市
无经验要求
实习生
仅现场办公
硕士
机器学习工程
Gui Agent
多模态Rag
多模态大模型
大语言模型
强化学习
机器学习
Ai Memory

AI 估算 · 5k–10k

研究型实习生岗位,杭州大厂实习月薪约5000-10000元,考虑学历要求硕士博士及研究性质。

职位详情

关于这个职位

这是一个面向多模态大模型和GUI Agent的研究型实习岗位,你将参与探索多模态大模型、AI记忆、多模态RAG等前沿技术,并研究面向真实环境的智能体多轮强化学习方法,提升大模型泛化能力

适合对人工智能研究有热情、具有扎实机器学习基础的硕士或博士

最低要求

计算机科学、人工智能、机器学习或相关领域的硕士或博士学位

在多模态、大语言模型、Agent、机器学习等一个或多个领域有较深入的研究
具有出色的分析、解决问题的能力,能深入解决大模型训练、应用存在的问题,有自主探索解决方案的能力者
能够积极创新, 乐于面对挑战, 负责敬业,优秀的团队合作精神,一起探索新技术,推进技术进步

工作职责

探索研究多模态大模型、GUI agent、AI memory、多模态RAG等前沿技术

参与研发多模态、全模态大模型等下一代人工智能核心技术,探索面向真实环境的多模态智能体多轮强化学习,提升大模型能力
负责跟踪和研究多模态大模型前沿技术调研、落地、对业务进行优化

优先资格

具有优秀的基础算法、扎实的机器学习基础,在NeurIPS、ICLR、ICML、ACL、CVPR等顶级会议/期刊上发表论文者优先

具有优秀的代码能力,在ACM/ICPC、NOI/IOl、Top Coder、Kaggle等比赛获奖者优先
在多模态、大模型、基础模型、世界模型、RL领域,主导过大影响力项目者优先

AI 洞察

优缺点分析

优点

  • 接触大厂核心AI研究资源,技术栈前沿,与顶尖研究员合作
  • 大厂平台背书,实习经历含金量高,对后续求职或深造帮助大
  • 研究型岗位对学术背景要求高,需具备扎实的理论和动手能力
  • 实习期间需要快速适应大厂工作节奏和内部协作流程

缺点 / 挑战

  • 研究课题具有挑战性和创新性,容易产出高质量论文和专利
  • 多轮强化学习与多模态结合复杂度高,实验周期长,可能面临较大科研压力
  • 适合机器学习基础扎实、对多模态大模型和智能体研究有强烈兴趣的硕士或博士,乐于挑战前沿问题并具备较强自驱力

角色解读

  • 作为研究型实习生,可深入参与业界领先的AI项目,积累多模态与强化学习实战经验
  • 表现优秀者可获得转正机会,未来可发展为算法工程师或研究科学家
  • 顶会论文发表机会多,为学术或工业界职业发展铺路
  • 探索多模态大模型、GUI Agent、AI Memory、多模态RAG等前沿技术,进行学术研究和原型验证
  • 针对真实环境中的多模态智能体,研究多轮强化学习算法,提升大模型的泛化能力和交互决策能力
  • 跟踪最新研究动态,将前沿技术落地到实际业务场景,持续优化模型效果
  • 扎实的机器学习和大模型基础知识,了解Transformer、RLHF等核心原理
  • 具备多模态、大语言模型或Agent至少一个领域的研究经验
  • 过硬的编程能力,熟悉Python和主流深度学习框架(PyTorch等)
  • 良好的分析问题和自主探索能力,能够独立解决训练和应用中的技术难题

申请策略

  • 申请时附上个人GitHub或技术博客,展示动手能力和对AI的热情
  • 了解阿里巴巴在通义千问、多模态智能体方面的布局,在面试中体现业务理解
  • 突出论文发表经历,尤其是NeurIPS、ICML、ACL、CVPR等顶会,展示研究深度
  • 强调与多模态、大模型、强化学习相关的项目经验,说明自己的具体贡献和成果
  • 量化竞赛获奖或开源项目影响力,体现代码能力和工程实践能力
  • 补充多模态RAG、AI Memory等领域的知识,可快速阅读最新论文
  • 熟悉强化学习常用框架(如RLlib、Stable-Baselines3)和分布式训练方法
  • 提升Python和PyTorch使用熟练度,掌握大模型微调和推理的常见工具

面试指南

  • 采用STAR法则:情境(Situation)-任务(Task)-行动(Action)-结果(Result),清晰展现研究思路和成果
  • 先阐述问题背景和难点,再介绍你的方案选择依据,最后总结效果和思考
  • 对于开放式研究问题,可展示你的分析框架和假设,再给出验证思路
  • 讲讲你在多模态或大模型领域的研究工作,具体解决了什么问题?
  • 为什么选择多轮强化学习来提升GUI Agent的泛化能力?有哪些技术挑战?
  • 如何设计奖励函数来引导智能体在真实环境中高效学习?
  • 你如何看待多模态RAG与AI Memory在智能体中的作用?
  • 描述一次你独立解决一个复杂机器学习问题的经历

职位点评

72
综合评分

大厂AI研究实习,前沿技术栈,成长空间大,但薪资未明确,需现场办公。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
该职位最适合追求技术成长和前沿科研体验的求职者,对补偿性要求不高。
表现最好
成长发展
相对薄弱
薪资福利
薪资福利50
成长发展88
工作生活60
使命价值75

薪资福利

50较低

该实习岗位薪酬未详细披露,无明确福利信息,但大厂实习通常有较好补贴,补偿性动机满足一般。

薪资信号未披露(AI估算:5K-10K/月)

成长发展

88较高

岗位聚焦多模态大模型、强化学习等前沿技术,参与核心项目,有发表论文和转正机会,发展性动机满足度高。

技术前沿前沿/新兴技术
技术栈多模态大模型、GUI Agent、强化学习、多模态RAG、AI Memory、大语言模型
业务类型ambiguous

工作生活

60中等

工作地点在杭州阿里巴巴园区,要求现场办公,未提及弹性或远程,生活化动机满足程度中等。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

75中等

从事AI前沿技术研究,具有较高的创新性和一定的社会价值,能给求职者带来意义感。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs