Ant Group logo
蚂蚁集团
蚂蚁集团-图像 / 视频生成算法工程师-AIGC方向

蚂蚁集团-图像 / 视频生成算法工程师-AIGC方向

发布于 大约 3 小时前

普通员工/个人贡献者

北京市 / 杭州市
高级经验
全职员工
仅现场办公
本科
计算机视觉工程
Clip
Controlnet
Diffusion Models
Gan
Pytorch
图像生成
多模态
视频生成

AI 估算 · 35k–60k

蚂蚁集团作为头部互联网公司,对AIGC算法人才需求强烈,薪资有竞争力,结合北京/杭州市场水平,预计月薪在35-60K。

职位详情

关于这个职位

该职位专注于图像与视频生成领域的算法研发,涉及文本生成图像/视频、图像编辑等前沿方向

你将负责生成模型的研发与优化,并推动技术落地到蚂蚁集团的实际业务中,例如短视频生成、图像编辑工具等
适合在深度学习、生成式AI领域有深厚积累,并渴望将前沿技术转化为产品的算法人才

最低要求

计算机、人工智能、数学、电子工程等相关专业,本科及以上学历,硕博优先

精通深度学习理论,熟悉常用框架(如 PyTorch、TensorFlow),能够独立实现和调优深度生成模型
有 Diffusion Models、GAN、VAE 等生成式建模经验,熟悉 Stable Diffusion、Imagen、DALL·E 或相关开源项目
熟悉 Transformer 在视觉、视频任务中的应用,如 Vision Transformer、Video Transformer、Latent Diffusion 等
有多模态任务经验(如文本转图像、文本转视频、视频到视频),掌握 CLIP、BLIP、align 模型等跨模态技术
具备模型可控性技术经验,例如 ControlNet,LoRA,DreamBooth,条件生成等
熟悉数据处理与增强方法,能够构建高质量训练数据集
有云端模型部署经验(如 ONNX、TensorRT、Docker、K8s),熟悉性能优化与成本控制
具有较强的算法研发能力、问题分析和解决能力,能主动跟进前沿技术并在项目中快速应用
有竞赛获奖或在计算机视觉 / 多模态生成领域的顶会论文(CVPR、ICCV、ECCV、NeurIPS、SIGGRAPH 等)优先

工作职责

负责深度学习、生成式模型在图像与视频生成领域的研发与优化,包括文本生成图像(text-to-image)、文本生成视频(text-to-video)、图像/视频编辑等

研究并实现前沿的生成模型架构(如 Diffusion Models、GAN、Transformer、NeRF 等)以及多模态融合技术(文本、音频、视频、图像)
结合业务需求,设计和训练高质量的生成模型,提升生成结果的真实感、美学质量、语义一致性和可控性
建立数据采集与清洗流程,构建高质量的训练、微调和评估数据集(涵盖图像、视频、多模态)
设计、实现并维护模型推理服务,包括模型部署、性能优化、成本控制和稳定性保障
对生成模型的评测指标进行研究和完善,包括自动化评分、用户反馈收集、强化学习奖励函数等
跟进计算机视觉、生成式AI、多模态领域业界及学术新技术,并快速验证和落地

优先资格

有实际落地的生成式AI产品经验(例如短视频生成、图像编辑工具、游戏或虚拟人视频生成)

有国际一流开源社区贡献经历
熟悉 RLHF(Human Feedback)和奖励模型在图像/视频生成中的应用
有美术、摄影、动画、影视后期相关领域的背景,对视觉效果有审美能力
熟悉分布式训练、数据并行/模型并行优化
使用过大规模多模态模型(如 GPT-4V、Gemini、LLaVA、Kosmos-2 等)

AI 洞察

优缺点分析

优点

  • 蚂蚁集团平台大、资源丰富,能接触到海量业务数据和真实场景,有利于技术沉淀
  • AIGC是当前最热门的赛道之一,技术前沿,发展空间大,跳槽时竞争力强
  • 团队学术氛围浓厚,有机会发表顶会论文,与业界顶尖人才交流
  • 技术要求极高,需要同时掌握生成模型、多模态、部署优化等多领域知识
  • 竞争激烈,同赛道大厂都在招揽人才,需要持续学习保持领先

缺点 / 挑战

  • 业务落地压力大,需要快速迭代模型并满足产品需求,工作强度可能较高
  • 适合在深度学习、计算机视觉领域有扎实基础,特别是对生成式AI有浓厚兴趣,愿意挑战前沿技术并将其转化为实际产品的算法工程师

角色解读

  • 可向技术专家方向发展,在AIGC领域深耕,成为团队核心算法负责人
  • 也可转型为技术管理(Tech Lead),带领团队攻克生成式AI难题
  • 若对业务感兴趣,可凭借算法背景转向AI产品经理或解决方案架构师
  • 主要研发图像和视频生成模型,如文本生成图像/视频、图像编辑等,推动技术从论文到产品落地
  • 你需要设计与优化Diffusion、GAN等生成模型架构,提升生成质量、可控性和效率
  • 负责构建大规模训练数据集,并参与模型部署与性能优化,确保服务稳定经济
  • 持续跟踪学术与工业界前沿技术,快速验证并应用到实际业务场景中
  • 扎实的深度学习基础,熟悉PyTorch/TensorFlow,能独立实现和调优生成模型
  • 精通Diffusion Models、GAN、VAE等生成式模型,熟悉Stable Diffusion、DALL·E等开源项目
  • 熟悉多模态技术(如CLIP、BLIP),以及Transformer在视觉任务中的应用
  • 具备模型可控性技术经验(如ControlNet、LoRA),并有云端部署经验(ONNX、TensorRT、Docker等)

申请策略

  • 在简历和面试中强调对AIGC领域的热情和持续学习能力,展现对蚂蚁业务场景的理解
  • 建议提前了解蚂蚁在数字人、短视频、内容创意等方向的产品,思考如何用生成技术赋能
  • 突出生成模型项目经验,尤其是Diffusion Models、GAN等具体工作,附上效果展示或开源项目链接
  • 强调顶会论文、竞赛获奖或开源贡献,这些都是硬加分项
  • 展示多模态、可控性技术(如ControlNet、LoRA)的实际应用案例
  • 如果有产品落地经验(如短视频生成工具),务必详细描述
  • 深入掌握Stable Diffusion、Imagen等主流开源项目的代码和原理
  • 补充RLHF、奖励模型在生成领域的实践知识

面试指南

  • 对于技术原理问题,建议从数学推导和直觉理解两个层面回答,并联系实际应用
  • 对于项目经验问题,采用STAR法则:背景-任务-行动-结果,突出你的贡献和思考
  • 对于开放性问题(如系统设计),先明确目标,再分模块讨论,最后总结trade-off
  • 请详细讲解Diffusion模型的原理,包括前向扩散和反向去噪过程、训练目标
  • 你如何设计ControlNet来让生成图像遵循用户指定的条件?请举例说明
  • 在文本生成视频任务中,如何处理帧间一致性和时间连续性?
  • 你如何评价一个生成模型的性能?除了FID、IS,还有哪些你认为重要的指标?
  • 请分享一个你实际落地的生成式AI项目,包括技术选型、遇到的挑战和解决方案

职位点评

70
综合评分

大厂AIGC顶尖算法岗,技术前沿、薪资优厚,但工作强度较大,WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术前沿和快速成长的求职者,愿意投入高强度学习与工作以换取职业发展机会。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活40
使命价值60

薪资福利

75中等

蚂蚁集团薪资竞争力强,提供有竞争力的薪酬和福利,但职位描述未明确具体薪资水平,需面议确定。

薪资信号面议 (35K-60K/月)

成长发展

90较高

该职位技术要求高,专注于AIGC前沿方向,有大量学习机会,蚂蚁集团也支持学术发表和新技术探索,发展性极强。

技术前沿前沿/新兴技术
技术栈Diffusion Models、GAN、Transformer、多模态、Stable Diffusion、ControlNet、RLHF
成长机会顶会论文优先
业务类型profit_center

工作生活

40较低

该职位仅现场办公,未提及弹性工作或远程,互联网公司高强度工作可能影响WLB,但蚂蚁在杭州/北京核心地段,通勤便利性一般。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

60中等

AIGC领域具有较高行业前景和社会影响力,但蚂蚁集团业务偏商业应用,社会使命感相对中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs