Alibaba logo
阿里巴巴
ATH事业群-视频增强和生成算法专家-杭州

ATH事业群-视频增强和生成算法专家-杭州

发布于 大约 14 小时前

普通员工/个人贡献者

杭州市
高级经验
全职员工
仅现场办公
硕士
计算机视觉工程
Deepspeed
Diffusion
Pytorch
Rlhf
Sft
Wan
图像生成
多模态
视频生成

AI 估算 · 35k–60k

算法专家岗位技术门槛高,阿里平台溢价,月薪3.5-6万,16薪,总包可观。

职位详情

关于这个职位

作为阿里云视频增强与生成算法专家,你将深入电商、影视、广告等真实业务场景,基于Wan、Qwen-Image等自研大模型,负责图像视频生成、可控编辑、画质超分等核心算法研发与落地

该岗位需要扎实的生成模型基础,参与大模型后训练与数据飞轮建设,推动AI在行业场景中的规模化应用

最低要求

计算机、人工智能、数学等相关专业硕士/博士学位, 在图像/视频生成、画质增强、超分、多模态学习、大模型后训练等领域具备扎实的理论基础;

实战经验与工程能力: 有实际落地图像生成、视频生成、画质增强或多模态项目经验,能处理真实场景中的指令遵循、主体一致性、长视频时序稳定性、可控编辑、低资源风格定制、真实退化建模等问题;
熟悉主流图像视频生成与增强技术体系(如 VAE、GAN、Diffusion、Flow Matching 等生成建模范式,以及 SwinIR、Real-ESRGAN、StableSR 等增强与生成式超分方案),熟悉图像/视频生成模型(如 FLUX、Wan、Qwen-Image 等)的架构与训练范式;
精通生成模型后训练技术(如监督微调 SFT、偏好对齐 RLHF/DPO、Diffusion-DPO、持续学习等),熟悉大模型分布式训练与加速技术(如 DeepSpeed、PyTorch FSDP、Megatron-LM/Megatron-Core 等)
对 AI 云产品和行业智能化升级有强烈兴趣,能将算法创新与客户业务痛点紧密结合,具备优秀的跨团队协作与项目推进能力

工作职责

业务攻坚与定制化调优: 深入理解业务场景(如电商商品图/视频生成、营销创意、影视后期、广告设计、虚拟人、教育动画、工业设计等), 针对客户真实需求和挑战问题(如指令遵循、主体一致性、文字渲染、物理合理性、长视频时序稳定性、风格定制等)进行算法攻坚

大模型增强: 利用后训练全链路技术和数据飞轮(数据构建 → 模型微调 → 强化对齐 → 效果评测),增强模型的图像生成、视频生成、可控编辑、ID/主体保持、镜头与运动控制等核心能力,并将评测、数据和算法能力沉淀到基座模型,持续提升通用图像视频大模型在真实场景中的表现
图像视频增强与超分: 研发图像/视频画质增强与超分能力,包括超分、去噪去模糊、插帧、色彩/HDR 增强与修复等,并结合生成式先验打通“生成 + 增强”链路,支撑高画质业务交付

优先资格

加分项:(1) 主导或深度参与过图像生成、视频生成、画质增强或多模态生成模型从 0 到 1 的训练或大规模落地项目; (2) 有可控图像/视频生成、图像/视频编辑、视频超分/修复等可控生成与增强方向的深度实践经验; (3) 有视频编解码相关的背景

(4) 熟悉 AIGC 评测体系建设(自动化评测、VLM-as-Judge、人类偏好数据采集与建模,以及 PSNR / SSIM / LPIPS / DOVER 等画质评测指标); (5) 有训练或推理加速部署经验(蒸馏、量化、Step Distillation 等); (6) 在图像、视频、多模态相关方向有顶会论文发表(CVPR / ICCV / ECCV / NeurIPS / ICLR / ICML / SIGGRAPH)

AI 洞察

优缺点分析

优点

  • 阿里云平台,业务场景丰富,能够接触大规模真实数据和客户需求
  • 团队自研Wan等大模型,处于AIGC前沿,技术成长快
  • 薪酬福利优厚,有股票和年终奖,职业背书强
  • 技术迭代快,需要持续学习和研究,竞争激烈
  • 大厂协作流程复杂,跨团队沟通成本高

缺点 / 挑战

  • 业务落地压力大,需要快速解决实际问题,可能面临高强度工作
  • 适合在图像视频生成或增强领域有深厚技术积累,热爱真实业务挑战,愿意推动技术商业化的工程师

角色解读

  • 技术专家路线:深入模型研究与创新,成为领域科学家或首席专家
  • 业务/产品路线:转向解决方案架构师或AI产品专家,融合业务与技术
  • 管理路线:积累经验后带领算法团队,负责技术方向与业务落地
  • 针对电商、影视、广告等真实业务场景,对图像/视频生成大模型进行定制化调优,解决指令遵循、主体一致性等问题
  • 研发视频超分、去噪、插帧等画质增强技术,并探索生成式先验与增强链路融合
  • 参与大模型后训练全流程,包括SFT、RLHF/DPO等,建设数据飞轮提升模型能力
  • 与工程和产品团队协作,将算法能力落地到云产品,支撑高画质业务交付
  • 扎实的深度学习基础,熟悉VAE、GAN、Diffusion、Flow Matching等生成模型
  • 熟悉主流图像/视频生成模型架构与训练,如Wan、Qwen-Image、FLUX
  • 掌握后训练技术(SFT、RLHF/DPO、持续学习)及分布式训练框架(DeepSpeed、FSDP)
  • 有图像/视频增强超分项目经验,熟悉SwinIR、Real-ESRGAN等方案

申请策略

  • 提前了解阿里云AI业务方向(如通义万相、视频云),思考算法如何支撑商业化
  • 准备与业务结合的项目案例,突出以业务为导向的技术决策
  • 突出参与过的图像/视频生成项目,尤其是从0到1的训练或大规模落地经验
  • 详细列出熟悉的模型架构和工具,如Diffusion、Wan、DeepSpeed等
  • 强调解决具体问题的能力,例如如何保证主体一致性、可控编辑
  • 如有顶会论文或相关专利,务必显著展示
  • 补充RLHF/DPO等后训练技术的实际经验,可通过开源项目练习
  • 熟悉阿里云或业界最新的生成模型,如Wan、Qwen-Image的原理与技术报告

面试指南

  • 采用STAR法则:情境-任务-行动-结果,清晰描述项目背景、挑战、做法和量化效果
  • 对于技术原理题,先讲核心思想,再结合公式或流程细节,最后提到在实践中的取舍
  • 开放性问题要展示逻辑层次,如定义问题、分析维度、提出解决方案和验证方法
  • 请详细介绍一个你参与过的视频生成或增强项目,包括技术方案和难点突破
  • Diffusion模型的核心训练过程是什么?如何控制生成质量?
  • RLHF在生成模型中的具体应用流程是什么?
  • 长视频生成中如何保证时序稳定性?
  • 如何设计一套评测体系来衡量视频生成效果?

职位点评

76
综合评分

阿里云算法专家,前沿生成技术,高薪高成长,但需现场办公且工作强度可能较高。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术前沿和职业成长,能够承受一定工作强度,对AI商业落地充满热情的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活55
使命价值70

薪资福利

80较高

薪资水平在行业中极具竞争力,但JD未明确细节,整体补偿性较强。

薪资信号未披露(AI估算:35K-60K/月)

成长发展

90较高

岗位处于AIGC前沿,技术栈新,成长空间大,能深入模型训练与业务落地。

技术前沿前沿/新兴技术
技术栈Diffusion、Wan、Qwen-Image、RLHF、SFT、多模态、视频生成、超分
业务类型profit_center

工作生活

55较低

杭州现场办公,JD未提及弹性或远程,大厂算法岗位工作强度大概率较高,生活方式平衡一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI技术推动产业智能化,有社会价值,但主要为商业场景服务,意义感中性偏积极。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs