
阿里巴巴
ATH事业群-视频增强和生成算法专家-杭州
ATH事业群-视频增强和生成算法专家-杭州
发布于 大约 14 小时前普通员工/个人贡献者
杭州市
高级经验
全职员工
仅现场办公
硕士
计算机视觉工程
Deepspeed
Diffusion
Pytorch
Rlhf
Sft
Wan
图像生成
多模态
视频生成
AI 估算 · 35k–60k
算法专家岗位技术门槛高,阿里平台溢价,月薪3.5-6万,16薪,总包可观。
职位详情
关于这个职位
作为阿里云视频增强与生成算法专家,你将深入电商、影视、广告等真实业务场景,基于Wan、Qwen-Image等自研大模型,负责图像视频生成、可控编辑、画质超分等核心算法研发与落地
该岗位需要扎实的生成模型基础,参与大模型后训练与数据飞轮建设,推动AI在行业场景中的规模化应用
最低要求
计算机、人工智能、数学等相关专业硕士/博士学位, 在图像/视频生成、画质增强、超分、多模态学习、大模型后训练等领域具备扎实的理论基础;
实战经验与工程能力: 有实际落地图像生成、视频生成、画质增强或多模态项目经验,能处理真实场景中的指令遵循、主体一致性、长视频时序稳定性、可控编辑、低资源风格定制、真实退化建模等问题;
熟悉主流图像视频生成与增强技术体系(如 VAE、GAN、Diffusion、Flow Matching 等生成建模范式,以及 SwinIR、Real-ESRGAN、StableSR 等增强与生成式超分方案),熟悉图像/视频生成模型(如 FLUX、Wan、Qwen-Image 等)的架构与训练范式;
精通生成模型后训练技术(如监督微调 SFT、偏好对齐 RLHF/DPO、Diffusion-DPO、持续学习等),熟悉大模型分布式训练与加速技术(如 DeepSpeed、PyTorch FSDP、Megatron-LM/Megatron-Core 等)
对 AI 云产品和行业智能化升级有强烈兴趣,能将算法创新与客户业务痛点紧密结合,具备优秀的跨团队协作与项目推进能力
工作职责
业务攻坚与定制化调优: 深入理解业务场景(如电商商品图/视频生成、营销创意、影视后期、广告设计、虚拟人、教育动画、工业设计等), 针对客户真实需求和挑战问题(如指令遵循、主体一致性、文字渲染、物理合理性、长视频时序稳定性、风格定制等)进行算法攻坚
大模型增强: 利用后训练全链路技术和数据飞轮(数据构建 → 模型微调 → 强化对齐 → 效果评测),增强模型的图像生成、视频生成、可控编辑、ID/主体保持、镜头与运动控制等核心能力,并将评测、数据和算法能力沉淀到基座模型,持续提升通用图像视频大模型在真实场景中的表现
图像视频增强与超分: 研发图像/视频画质增强与超分能力,包括超分、去噪去模糊、插帧、色彩/HDR 增强与修复等,并结合生成式先验打通“生成 + 增强”链路,支撑高画质业务交付
优先资格
加分项:(1) 主导或深度参与过图像生成、视频生成、画质增强或多模态生成模型从 0 到 1 的训练或大规模落地项目; (2) 有可控图像/视频生成、图像/视频编辑、视频超分/修复等可控生成与增强方向的深度实践经验; (3) 有视频编解码相关的背景
(4) 熟悉 AIGC 评测体系建设(自动化评测、VLM-as-Judge、人类偏好数据采集与建模,以及 PSNR / SSIM / LPIPS / DOVER 等画质评测指标); (5) 有训练或推理加速部署经验(蒸馏、量化、Step Distillation 等); (6) 在图像、视频、多模态相关方向有顶会论文发表(CVPR / ICCV / ECCV / NeurIPS / ICLR / ICML / SIGGRAPH)
AI 洞察
优缺点分析
优点
- 阿里云平台,业务场景丰富,能够接触大规模真实数据和客户需求
- 团队自研Wan等大模型,处于AIGC前沿,技术成长快
- 薪酬福利优厚,有股票和年终奖,职业背书强
- 技术迭代快,需要持续学习和研究,竞争激烈
- 大厂协作流程复杂,跨团队沟通成本高
缺点 / 挑战
- 业务落地压力大,需要快速解决实际问题,可能面临高强度工作
- 适合在图像视频生成或增强领域有深厚技术积累,热爱真实业务挑战,愿意推动技术商业化的工程师
角色解读
- 技术专家路线:深入模型研究与创新,成为领域科学家或首席专家
- 业务/产品路线:转向解决方案架构师或AI产品专家,融合业务与技术
- 管理路线:积累经验后带领算法团队,负责技术方向与业务落地
- 针对电商、影视、广告等真实业务场景,对图像/视频生成大模型进行定制化调优,解决指令遵循、主体一致性等问题
- 研发视频超分、去噪、插帧等画质增强技术,并探索生成式先验与增强链路融合
- 参与大模型后训练全流程,包括SFT、RLHF/DPO等,建设数据飞轮提升模型能力
- 与工程和产品团队协作,将算法能力落地到云产品,支撑高画质业务交付
- 扎实的深度学习基础,熟悉VAE、GAN、Diffusion、Flow Matching等生成模型
- 熟悉主流图像/视频生成模型架构与训练,如Wan、Qwen-Image、FLUX
- 掌握后训练技术(SFT、RLHF/DPO、持续学习)及分布式训练框架(DeepSpeed、FSDP)
- 有图像/视频增强超分项目经验,熟悉SwinIR、Real-ESRGAN等方案
申请策略
- 提前了解阿里云AI业务方向(如通义万相、视频云),思考算法如何支撑商业化
- 准备与业务结合的项目案例,突出以业务为导向的技术决策
- 突出参与过的图像/视频生成项目,尤其是从0到1的训练或大规模落地经验
- 详细列出熟悉的模型架构和工具,如Diffusion、Wan、DeepSpeed等
- 强调解决具体问题的能力,例如如何保证主体一致性、可控编辑
- 如有顶会论文或相关专利,务必显著展示
- 补充RLHF/DPO等后训练技术的实际经验,可通过开源项目练习
- 熟悉阿里云或业界最新的生成模型,如Wan、Qwen-Image的原理与技术报告
面试指南
- 采用STAR法则:情境-任务-行动-结果,清晰描述项目背景、挑战、做法和量化效果
- 对于技术原理题,先讲核心思想,再结合公式或流程细节,最后提到在实践中的取舍
- 开放性问题要展示逻辑层次,如定义问题、分析维度、提出解决方案和验证方法
- 请详细介绍一个你参与过的视频生成或增强项目,包括技术方案和难点突破
- Diffusion模型的核心训练过程是什么?如何控制生成质量?
- RLHF在生成模型中的具体应用流程是什么?
- 长视频生成中如何保证时序稳定性?
- 如何设计一套评测体系来衡量视频生成效果?
职位点评
76
综合评分
阿里云算法专家,前沿生成技术,高薪高成长,但需现场办公且工作强度可能较高。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿和职业成长,能够承受一定工作强度,对AI商业落地充满热情的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活55
使命价值70
薪资福利
80较高
薪资水平在行业中极具竞争力,但JD未明确细节,整体补偿性较强。
薪资信号未披露(AI估算:35K-60K/月)
成长发展
90较高
岗位处于AIGC前沿,技术栈新,成长空间大,能深入模型训练与业务落地。
技术前沿前沿/新兴技术
技术栈Diffusion、Wan、Qwen-Image、RLHF、SFT、多模态、视频生成、超分
业务类型profit_center
工作生活
55较低
杭州现场办公,JD未提及弹性或远程,大厂算法岗位工作强度大概率较高,生活方式平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
AI技术推动产业智能化,有社会价值,但主要为商业场景服务,意义感中性偏积极。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs