
安克创新
视频/世界模型(具身方向)实习生
视频/世界模型(具身方向)实习生
发布于 大约 9 小时前实习/见习
深圳市
无经验要求
实习生
仅现场办公
硕士
具身智能
Diffusion Model
Pytorch
世界模型
具身智能
强化学习
数据增强
机器人操作
视频生成
AI 估算 · 8k–15k
AI 研究实习,技术难度高,公司平台大,薪资有竞争力。
职位详情
关于这个职位
该职位是安克创新面向在校硕士/博士生的研究型实习岗位,聚焦视频生成模型、世界模型及具身智能方向
你将参与前沿模型训练、数据增强算法研发和强化学习奖励模型设计,表现优秀可直接获得校招转正机会
适合对AI和机器人有浓厚兴趣、自我驱动能力强的同学
最低要求
硕士及以上学历在读,计算机、人工智能、机器人、自动化等相关专业优先,2026年及以后毕业优先
深刻理解视频模型、世界模型核心架构,同时熟悉具身操作模型(VA/VLA/WAM)相关技术
熟悉计算机视觉基础知识,如图像分割、深度估计、光流、相机模型、坐标变换或多视角几何
熟悉 Python 编程,具备良好的工程能力与代码规范意识
熟悉 PyTorch 等深度学习框架,理解 Transformer、Diffusion Model、VAE 等常见模型
具备较强的论文阅读和复现能力,能够快速理解并验证方法
工作职责
参与视频生成模型、视频编辑模型以及世界模型的训练、微调和评估,如 Wan、Cosmos transfer 等
参与机器人数据增强算法研发,包括目标分割、深度估计、背景/材质替换、视角一致性与时序一致性优化等
研究以机器人动作、文本指令、深度和分割为条件的视频模型,探索面向机器人控制的世界模型
负责机器人视频数据的清洗、标注、采样、增强及质量评估,建设高效可靠的数据处理流水线
参与面向视频生成模型的奖励模型研发,为强化学习后训练提供可靠的奖励信号与算法支持
跟进视频生成、世界模型和机器人操作方向的最新论文,探索最新技术
优先资格
有 Diffusion、DiT、视频生成/编辑模型或世界模型训练、微调经验
熟悉 Wan、VACE、FLUX、Stable Diffusion、Cosmos、Sana类模型或相关开源项目
在具身智能、多模态大模型、机器人数据集等方向有科研或开源项目经历
学术成果:在机器人或计算机视觉顶会、顶刊发表过关于具身模型或数据增强的高质量论文
前沿生产力工具:熟练使用 Claude code、Codex、Cursor等工具进行高效代码开发与系统构建
AI 洞察
优缺点分析
优点
- 接触前沿技术:视频生成、世界模型、具身智能是当前 AI 热门方向,技术含金量高
- 公司平台好:安克创新为上市公司,资源充足,项目真实落地
- 转正机会大:实习项目严格按校招标准培养,优秀者可直接获得正式 offer
- 团队成长环境:有系统的培养机制,可快速提升研究与实践能力
- 研究难度大:世界模型和具身智能属于前沿领域,需要较强的理论基础和自学能力
- 竞争激烈:实习生项目标准高,可能面临严格的评估
- 适合对视频生成、世界模型和具身智能有浓厚兴趣,且具备较强自驱力和研究能力的在校研究生
缺点 / 挑战
- 工作强度可能较高:研究型实习通常需要投入大量时间阅读论文和做实验
角色解读
- 实习表现优秀可转正为校招正式员工,进入 AI 研究院或相关团队
- 积累视频生成与具身智能的前沿经验,向算法工程师或研究科学家方向发展
- 有机会发表顶会论文,参与开源项目,提升学术影响力
- 参与视频生成模型、世界模型的训练、微调和评估,使用 Wan、Cosmos 等前沿模型
- 研发机器人数据增强算法,包括分割、深度估计、背景/材质替换及时序一致性优化
- 构建机器人视频数据处理流水线,涵盖数据清洗、标注、采样和质量评估
- 研发奖励模型,为强化学习后训练提供信号支持,并跟踪前沿论文动态
- 扎实的计算机视觉与深度学习基础,熟悉 Transformer、Diffusion Model 等架构
- 熟练使用 Python 和 PyTorch,具备良好的工程实践能力与代码规范
- 理解视频模型、世界模型及具身操作模型(VA/VLA/WAM)的核心技术
- 具备较强的论文阅读和复现能力,能快速验证新方法
申请策略
- 投递前了解安克创新在 AI 和机器人领域的最新动态,在面试中展示对业务的思考
- 准备一个能体现你研究能力的项目案例,详细说明你在其中的贡献
- 突出相关论文发表、开源项目或竞赛经历,尤其是视频生成、Diffusion 等方向
- 强调扎实的编程和动手能力,如 Python、PyTorch 及深度学习项目经验
- 展示对开源模型(如 Wan、Stable Diffusion、Cosmos)的深入理解或复现经历
- 若参与过机器人或具身智能项目,务必详细描述
- 提前学习 Diffusion Model、Transformer 等核心架构,并尝试复现相关论文
- 熟悉常见的视频生成/世界模型开源项目,如 Wan、Cosmos、Stable Diffusion
面试指南
- 可采用“背景-方法-贡献-反思”的结构回答项目或研究经历
- 针对技术问题,先阐述原理,再举例说明应用场景,最后总结优势与不足
- 对于开放性问题,展示系统思考能力,如从数据处理、模型设计、优化目标等维度展开
- 请介绍一下你对视频生成模型(如 Wan 或 Stable Diffusion)的理解及其关键挑战
- 你如何设计一个数据增强流程来提升机器人视频数据的时空一致性?
- 谈谈你在具身智能或世界模型方面的研究经验及常用方法
- 如何将 Diffusion 模型应用于机器人操作?你有哪些实践或想法?
- 你如何权衡模型效果与计算资源?在训练中遇到困难时如何排查?
职位点评
72
综合评分
前沿 AI 研究实习,技术成长空间大,但工作强度可能较高,现场办公。
从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。
更适合这类人
适合追求技术成长和职业发展的在校研究生,尤其是对具身智能和视频生成有热情、能适应高强度研究的同学。
表现最好
成长发展
相对薄弱
工作生活
薪资福利60
成长发展90
工作生活50
使命价值80
薪资福利
60中等
该职位为实习岗位,薪资待遇未明确,但公司为大型上市企业,实习津贴一般处于市场中上水平,且转正机会可带来长期回报。
薪资信号未披露(AI估算:8K-15K/月)
成长发展
90较高
该职位为研究型实习,聚焦前沿技术,提供系统培养和转正通道,技能成长和职业发展空间大。
技术前沿前沿/新兴技术
技术栈视频生成、世界模型、Diffusion Model、Transformer、PyTorch、Python、具身智能、强化学习、数据增强
成长机会系统的培养、综合评估、转正机会
业务类型ambiguous
工作生活
50较低
该职位为现场办公,工作地点位于深圳,未提及弹性工作或远程安排,实习强度可能较大。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
参与视频生成与世界模型研究,属于人工智能前沿领域,有望推动机器人技术发展,具有较高社会价值。
行业发展高速增长赛道
社会影响正向社会影响力较高
创新程度稳健跟随主流
Watch Jobs