Anker Innovations logo
安克创新
视频/世界模型(具身方向)实习生

视频/世界模型(具身方向)实习生

发布于 大约 9 小时前

实习/见习

深圳市
无经验要求
实习生
仅现场办公
硕士
具身智能
Diffusion Model
Pytorch
世界模型
具身智能
强化学习
数据增强
机器人操作
视频生成

AI 估算 · 8k–15k

AI 研究实习,技术难度高,公司平台大,薪资有竞争力。

职位详情

关于这个职位

该职位是安克创新面向在校硕士/博士生的研究型实习岗位,聚焦视频生成模型、世界模型及具身智能方向

你将参与前沿模型训练、数据增强算法研发和强化学习奖励模型设计,表现优秀可直接获得校招转正机会
适合对AI和机器人有浓厚兴趣、自我驱动能力强的同学

最低要求

硕士及以上学历在读,计算机、人工智能、机器人、自动化等相关专业优先,2026年及以后毕业优先

深刻理解视频模型、世界模型核心架构,同时熟悉具身操作模型(VA/VLA/WAM)相关技术
熟悉计算机视觉基础知识,如图像分割、深度估计、光流、相机模型、坐标变换或多视角几何
熟悉 Python 编程,具备良好的工程能力与代码规范意识
熟悉 PyTorch 等深度学习框架,理解 Transformer、Diffusion Model、VAE 等常见模型
具备较强的论文阅读和复现能力,能够快速理解并验证方法

工作职责

参与视频生成模型、视频编辑模型以及世界模型的训练、微调和评估,如 Wan、Cosmos transfer 等

参与机器人数据增强算法研发,包括目标分割、深度估计、背景/材质替换、视角一致性与时序一致性优化等
研究以机器人动作、文本指令、深度和分割为条件的视频模型,探索面向机器人控制的世界模型
负责机器人视频数据的清洗、标注、采样、增强及质量评估,建设高效可靠的数据处理流水线
参与面向视频生成模型的奖励模型研发,为强化学习后训练提供可靠的奖励信号与算法支持
跟进视频生成、世界模型和机器人操作方向的最新论文,探索最新技术

优先资格

有 Diffusion、DiT、视频生成/编辑模型或世界模型训练、微调经验

熟悉 Wan、VACE、FLUX、Stable Diffusion、Cosmos、Sana类模型或相关开源项目
在具身智能、多模态大模型、机器人数据集等方向有科研或开源项目经历
学术成果:在机器人或计算机视觉顶会、顶刊发表过关于具身模型或数据增强的高质量论文
前沿生产力工具:熟练使用 Claude code、Codex、Cursor等工具进行高效代码开发与系统构建

AI 洞察

优缺点分析

优点

  • 接触前沿技术:视频生成、世界模型、具身智能是当前 AI 热门方向,技术含金量高
  • 公司平台好:安克创新为上市公司,资源充足,项目真实落地
  • 转正机会大:实习项目严格按校招标准培养,优秀者可直接获得正式 offer
  • 团队成长环境:有系统的培养机制,可快速提升研究与实践能力
  • 研究难度大:世界模型和具身智能属于前沿领域,需要较强的理论基础和自学能力
  • 竞争激烈:实习生项目标准高,可能面临严格的评估
  • 适合对视频生成、世界模型和具身智能有浓厚兴趣,且具备较强自驱力和研究能力的在校研究生

缺点 / 挑战

  • 工作强度可能较高:研究型实习通常需要投入大量时间阅读论文和做实验

角色解读

  • 实习表现优秀可转正为校招正式员工,进入 AI 研究院或相关团队
  • 积累视频生成与具身智能的前沿经验,向算法工程师或研究科学家方向发展
  • 有机会发表顶会论文,参与开源项目,提升学术影响力
  • 参与视频生成模型、世界模型的训练、微调和评估,使用 Wan、Cosmos 等前沿模型
  • 研发机器人数据增强算法,包括分割、深度估计、背景/材质替换及时序一致性优化
  • 构建机器人视频数据处理流水线,涵盖数据清洗、标注、采样和质量评估
  • 研发奖励模型,为强化学习后训练提供信号支持,并跟踪前沿论文动态
  • 扎实的计算机视觉与深度学习基础,熟悉 Transformer、Diffusion Model 等架构
  • 熟练使用 Python 和 PyTorch,具备良好的工程实践能力与代码规范
  • 理解视频模型、世界模型及具身操作模型(VA/VLA/WAM)的核心技术
  • 具备较强的论文阅读和复现能力,能快速验证新方法

申请策略

  • 投递前了解安克创新在 AI 和机器人领域的最新动态,在面试中展示对业务的思考
  • 准备一个能体现你研究能力的项目案例,详细说明你在其中的贡献
  • 突出相关论文发表、开源项目或竞赛经历,尤其是视频生成、Diffusion 等方向
  • 强调扎实的编程和动手能力,如 Python、PyTorch 及深度学习项目经验
  • 展示对开源模型(如 Wan、Stable Diffusion、Cosmos)的深入理解或复现经历
  • 若参与过机器人或具身智能项目,务必详细描述
  • 提前学习 Diffusion Model、Transformer 等核心架构,并尝试复现相关论文
  • 熟悉常见的视频生成/世界模型开源项目,如 Wan、Cosmos、Stable Diffusion

面试指南

  • 可采用“背景-方法-贡献-反思”的结构回答项目或研究经历
  • 针对技术问题,先阐述原理,再举例说明应用场景,最后总结优势与不足
  • 对于开放性问题,展示系统思考能力,如从数据处理、模型设计、优化目标等维度展开
  • 请介绍一下你对视频生成模型(如 Wan 或 Stable Diffusion)的理解及其关键挑战
  • 你如何设计一个数据增强流程来提升机器人视频数据的时空一致性?
  • 谈谈你在具身智能或世界模型方面的研究经验及常用方法
  • 如何将 Diffusion 模型应用于机器人操作?你有哪些实践或想法?
  • 你如何权衡模型效果与计算资源?在训练中遇到困难时如何排查?

职位点评

72
综合评分

前沿 AI 研究实习,技术成长空间大,但工作强度可能较高,现场办公。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
适合追求技术成长和职业发展的在校研究生,尤其是对具身智能和视频生成有热情、能适应高强度研究的同学。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活50
使命价值80

薪资福利

60中等

该职位为实习岗位,薪资待遇未明确,但公司为大型上市企业,实习津贴一般处于市场中上水平,且转正机会可带来长期回报。

薪资信号未披露(AI估算:8K-15K/月)

成长发展

90较高

该职位为研究型实习,聚焦前沿技术,提供系统培养和转正通道,技能成长和职业发展空间大。

技术前沿前沿/新兴技术
技术栈视频生成、世界模型、Diffusion Model、Transformer、PyTorch、Python、具身智能、强化学习、数据增强
成长机会系统的培养、综合评估、转正机会
业务类型ambiguous

工作生活

50较低

该职位为现场办公,工作地点位于深圳,未提及弹性工作或远程安排,实习强度可能较大。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

80较高

参与视频生成与世界模型研究,属于人工智能前沿领域,有望推动机器人技术发展,具有较高社会价值。

行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度稳健跟随主流
Watch Jobs