
蚂蚁集团
蚂蚁集团-图像 / 视频生成算法工程师-AIGC方向
蚂蚁集团-图像 / 视频生成算法工程师-AIGC方向
发布于 大约 3 小时前普通员工/个人贡献者
北京市 / 杭州市
高级经验
全职员工
仅现场办公
本科
计算机视觉工程
Clip
Controlnet
Diffusion Models
Gan
Pytorch
图像生成
多模态
视频生成
AI 估算 · 35k–60k
蚂蚁集团作为头部互联网公司,对AIGC算法人才需求强烈,薪资有竞争力,结合北京/杭州市场水平,预计月薪在35-60K。
职位详情
关于这个职位
该职位专注于图像与视频生成领域的算法研发,涉及文本生成图像/视频、图像编辑等前沿方向
你将负责生成模型的研发与优化,并推动技术落地到蚂蚁集团的实际业务中,例如短视频生成、图像编辑工具等
适合在深度学习、生成式AI领域有深厚积累,并渴望将前沿技术转化为产品的算法人才
最低要求
计算机、人工智能、数学、电子工程等相关专业,本科及以上学历,硕博优先
精通深度学习理论,熟悉常用框架(如 PyTorch、TensorFlow),能够独立实现和调优深度生成模型
有 Diffusion Models、GAN、VAE 等生成式建模经验,熟悉 Stable Diffusion、Imagen、DALL·E 或相关开源项目
熟悉 Transformer 在视觉、视频任务中的应用,如 Vision Transformer、Video Transformer、Latent Diffusion 等
有多模态任务经验(如文本转图像、文本转视频、视频到视频),掌握 CLIP、BLIP、align 模型等跨模态技术
具备模型可控性技术经验,例如 ControlNet,LoRA,DreamBooth,条件生成等
熟悉数据处理与增强方法,能够构建高质量训练数据集
有云端模型部署经验(如 ONNX、TensorRT、Docker、K8s),熟悉性能优化与成本控制
具有较强的算法研发能力、问题分析和解决能力,能主动跟进前沿技术并在项目中快速应用
有竞赛获奖或在计算机视觉 / 多模态生成领域的顶会论文(CVPR、ICCV、ECCV、NeurIPS、SIGGRAPH 等)优先
工作职责
负责深度学习、生成式模型在图像与视频生成领域的研发与优化,包括文本生成图像(text-to-image)、文本生成视频(text-to-video)、图像/视频编辑等
研究并实现前沿的生成模型架构(如 Diffusion Models、GAN、Transformer、NeRF 等)以及多模态融合技术(文本、音频、视频、图像)
结合业务需求,设计和训练高质量的生成模型,提升生成结果的真实感、美学质量、语义一致性和可控性
建立数据采集与清洗流程,构建高质量的训练、微调和评估数据集(涵盖图像、视频、多模态)
设计、实现并维护模型推理服务,包括模型部署、性能优化、成本控制和稳定性保障
对生成模型的评测指标进行研究和完善,包括自动化评分、用户反馈收集、强化学习奖励函数等
跟进计算机视觉、生成式AI、多模态领域业界及学术新技术,并快速验证和落地
优先资格
有实际落地的生成式AI产品经验(例如短视频生成、图像编辑工具、游戏或虚拟人视频生成)
有国际一流开源社区贡献经历
熟悉 RLHF(Human Feedback)和奖励模型在图像/视频生成中的应用
有美术、摄影、动画、影视后期相关领域的背景,对视觉效果有审美能力
熟悉分布式训练、数据并行/模型并行优化
使用过大规模多模态模型(如 GPT-4V、Gemini、LLaVA、Kosmos-2 等)
AI 洞察
优缺点分析
优点
- 蚂蚁集团平台大、资源丰富,能接触到海量业务数据和真实场景,有利于技术沉淀
- AIGC是当前最热门的赛道之一,技术前沿,发展空间大,跳槽时竞争力强
- 团队学术氛围浓厚,有机会发表顶会论文,与业界顶尖人才交流
- 技术要求极高,需要同时掌握生成模型、多模态、部署优化等多领域知识
- 竞争激烈,同赛道大厂都在招揽人才,需要持续学习保持领先
缺点 / 挑战
- 业务落地压力大,需要快速迭代模型并满足产品需求,工作强度可能较高
- 适合在深度学习、计算机视觉领域有扎实基础,特别是对生成式AI有浓厚兴趣,愿意挑战前沿技术并将其转化为实际产品的算法工程师
角色解读
- 可向技术专家方向发展,在AIGC领域深耕,成为团队核心算法负责人
- 也可转型为技术管理(Tech Lead),带领团队攻克生成式AI难题
- 若对业务感兴趣,可凭借算法背景转向AI产品经理或解决方案架构师
- 主要研发图像和视频生成模型,如文本生成图像/视频、图像编辑等,推动技术从论文到产品落地
- 你需要设计与优化Diffusion、GAN等生成模型架构,提升生成质量、可控性和效率
- 负责构建大规模训练数据集,并参与模型部署与性能优化,确保服务稳定经济
- 持续跟踪学术与工业界前沿技术,快速验证并应用到实际业务场景中
- 扎实的深度学习基础,熟悉PyTorch/TensorFlow,能独立实现和调优生成模型
- 精通Diffusion Models、GAN、VAE等生成式模型,熟悉Stable Diffusion、DALL·E等开源项目
- 熟悉多模态技术(如CLIP、BLIP),以及Transformer在视觉任务中的应用
- 具备模型可控性技术经验(如ControlNet、LoRA),并有云端部署经验(ONNX、TensorRT、Docker等)
申请策略
- 在简历和面试中强调对AIGC领域的热情和持续学习能力,展现对蚂蚁业务场景的理解
- 建议提前了解蚂蚁在数字人、短视频、内容创意等方向的产品,思考如何用生成技术赋能
- 突出生成模型项目经验,尤其是Diffusion Models、GAN等具体工作,附上效果展示或开源项目链接
- 强调顶会论文、竞赛获奖或开源贡献,这些都是硬加分项
- 展示多模态、可控性技术(如ControlNet、LoRA)的实际应用案例
- 如果有产品落地经验(如短视频生成工具),务必详细描述
- 深入掌握Stable Diffusion、Imagen等主流开源项目的代码和原理
- 补充RLHF、奖励模型在生成领域的实践知识
面试指南
- 对于技术原理问题,建议从数学推导和直觉理解两个层面回答,并联系实际应用
- 对于项目经验问题,采用STAR法则:背景-任务-行动-结果,突出你的贡献和思考
- 对于开放性问题(如系统设计),先明确目标,再分模块讨论,最后总结trade-off
- 请详细讲解Diffusion模型的原理,包括前向扩散和反向去噪过程、训练目标
- 你如何设计ControlNet来让生成图像遵循用户指定的条件?请举例说明
- 在文本生成视频任务中,如何处理帧间一致性和时间连续性?
- 你如何评价一个生成模型的性能?除了FID、IS,还有哪些你认为重要的指标?
- 请分享一个你实际落地的生成式AI项目,包括技术选型、遇到的挑战和解决方案
职位点评
70
综合评分
大厂AIGC顶尖算法岗,技术前沿、薪资优厚,但工作强度较大,WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合追求技术前沿和快速成长的求职者,愿意投入高强度学习与工作以换取职业发展机会。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活40
使命价值60
薪资福利
75中等
蚂蚁集团薪资竞争力强,提供有竞争力的薪酬和福利,但职位描述未明确具体薪资水平,需面议确定。
薪资信号面议 (35K-60K/月)
成长发展
90较高
该职位技术要求高,专注于AIGC前沿方向,有大量学习机会,蚂蚁集团也支持学术发表和新技术探索,发展性极强。
技术前沿前沿/新兴技术
技术栈Diffusion Models、GAN、Transformer、多模态、Stable Diffusion、ControlNet、RLHF
成长机会顶会论文优先
业务类型profit_center
工作生活
40较低
该职位仅现场办公,未提及弹性工作或远程,互联网公司高强度工作可能影响WLB,但蚂蚁在杭州/北京核心地段,通勤便利性一般。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
60中等
AIGC领域具有较高行业前景和社会影响力,但蚂蚁集团业务偏商业应用,社会使命感相对中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
蚂蚁集团 的其他在招职位
相似职位推荐
Watch Jobs