
百度
视频视觉算法工程师(J104149)
视频视觉算法工程师(J104149)
发布于 大约 1 小时前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
学历未注明
计算机视觉工程
Aigc
Controlnet
Diffusion Model
Dit
Dpo
Gan
Lora
Vae
数字人
AI 估算 · 30k–50k
北京AIGC算法岗位,技能稀缺,薪资较高,百度平台稳定,3年以上经验可达40k月薪。
职位详情
关于这个职位
该职位负责研发电商场景下的图片和视频生成与理解模型,包括数字人直播、短视频生成、多模商品理解等
你将基于开源基座模型进行后训练优化,构建Agent系统,并推动算法在电商场景中的极致性能优化与落地
适合对AIGC、视觉生成有深厚积累的算法工程师
最低要求
深入理解GAN、VAE、Diffusion Model/CFM等视觉生成技术,精通DPO、LORA、蒸馏等训练方法,有成功的模型算法优化和应用经验
有3D人脸建模,talking-head生成,唇驱等数字人相关技术背景尤佳
熟悉Wan、CogVideoX等开源视频生成基座模型,精通DiT和mmDiT架构,了解可控生成技术和应用,如ControlNet,IP-adapter等
CV相关领域3年以上经验,具有扎实的算法理论和研发基础,熟练掌握常用CV算法和工具(分类、分割、超分等)
有顶会论文优先
具有AIGC电商带货,广告营销或AI短剧相关项目背景,对分镜语言、剪辑节奏有技术审美者优先
勤于钻研前沿技术,具备较强的自学能力,能够将技术应用到具体业务上
工作职责
基于开源基模和后训练算法,研发电商场景图片和视频生成与理解模型,基于商用和自研模型构建Agent,应用到电商数字人直播,短视频生成
研发多模理解Agent,应用于多模商品理解,视频人物动作、表情理解
构建分镜脚本智能生成系统,支持基于商品卖点或剧情梗概自动输出专业分镜方案
研发视频人物和背景分割、风格迁移等相关算法,结合电商数字人带货场景做极致算法性能优化,降低生成成本、提升生成效率
协同产品和运营持续提升产品能力,拓展技术应用规模,协同工程架构提升视频产能
优先资格
有3D人脸建模,talking-head生成,唇驱等数字人相关技术背景尤佳
有顶会论文优先
具有AIGC电商带货,广告营销或AI短剧相关项目背景,对分镜语言、剪辑节奏有技术审美者优先
AI 洞察
优缺点分析
优点
- 所在领域为当前AI最热门的AIGC方向,技术前沿且应用场景清晰,个人成长快
- 百度平台资源丰富,有成熟的AI基础设施和大规模业务场景,利于技术落地
- 团队涉及数字人、视频生成、多模理解等多个高价值方向,技能积累全面
- 大厂待遇稳定,有较好的薪资水平和晋升体系
- 技术迭代极快,需要持续学习最新模型和训练方法,保持技术先进性
- 跨团队协作频繁,需要较强的沟通能力和产品意识,不只是纯算法
缺点 / 挑战
- 电商场景对算法效果和成本有极高标准,可能面临性能优化压力
- 适合对生成模型有深入理解、热爱技术挑战、能在快节奏环境中持续学习的算法工程师
角色解读
- 专业路线:从算法工程师向资深算法专家或首席科学家发展,深耕AIGC与多模态方向
- 技术管理:积累项目经验后可转向技术Leader或技术经理,带领团队打造核心产品
- 业务跨界:深入了解电商业务后,可转型为AI产品经理或解决方案架构师,推动业务创新
- 负责电商场景下图片与视频生成模型的研发,包括基于开源基座模型进行后训练和微调,以适配数字人直播与短视频生成
- 构建多模理解Agent,用于商品理解、人物动作与表情分析,并开发分镜脚本智能生成系统
- 针对数字人带货场景优化视频人物/背景分割、风格迁移等算法,提升生成效率并降低成本
- 与产品和工程团队紧密协作,将算法模型应用到实际业务,并持续迭代提升产品能力
- 扎实的深度学习功底,精通GAN、VAE、Diffusion Model等生成模型,熟悉DPO、LORA、蒸馏等训法
- 熟悉Wan、CogVideoX等开源视频生成模型,理解DiT和mmDiT架构,掌握ControlNet等可控生成技术
- 熟练掌握常用CV算法与工具(分类、分割、超分等),3年以上核心算法研发经验
- 对业务场景有敏感度,能将算法落地到电商、广告等业务,并具备工程化优化能力
申请策略
- 投递前可了解百度在AIGC、电商数字人方面的业务布局,在面试中展现对业务的理解
- 准备一段项目视频或演示,展示你曾经生成的图片/视频效果,能更直观打动面试官
- 突出在Diffusion Model、GAN等生成模型上的实战经验,包括具体模型优化和落地案例
- 强调3D人脸建模、数字人、视频生成等垂直场景项目,展示业务理解
- 如有顶会论文或开源贡献,务必在显眼位置呈现
- 展示在电商或广告场景的算法应用成果,如降低生成成本、提升效率的数据
- 如果还不熟悉Wan或CogVideoX,建议提前阅读相关技术报告并动手复现Demo
- 深入理解DPO、LORA等训练方法,准备相关的调参经验与代码实践
面试指南
- STAR法则:回答项目经历时,说明情境、任务、行动、结果,突出量化指标
- 对比思路:在谈技术选型时,对比不同方案的优缺点,展示深度思考
- 业务导向:强调算法如何服务业务需求,并给出可衡量的收益
- 请详细讲讲你使用Diffusion Model做视频生成的某个项目,包括模型选择、训练策略和效果优化
- 如何理解mmDiT架构?你认为它在视频生成中的优势是什么?
- 在电商场景中,如何平衡视频生成的质量和成本?你会采用哪些优化手段?
- 如果让你基于开源模型构建一个数字人直播Agent,你的技术方案是什么?
- 谈一个你在算法落地过程中遇到的最大技术挑战,以及你是如何解决的
职位点评
74
综合评分
百度AIGC算法岗,前沿技术、高成长空间,但生活平衡一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、热爱前沿AI应用、能承受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展90
工作生活55
使命价值80
薪资福利
70中等
百度作为大厂,薪资水平有竞争力,但JD未提及具体数字和福利,补偿性满足中等偏上。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
90较高
职位处于AIGC技术前沿,涉及生成模型、多模态Agent等多个高成长领域,发展空间大。
技术前沿前沿/新兴技术
技术栈Diffusion Model、GAN、VAE、DPO、LORA、DiT、ControlNet、数字人
业务类型profit_center
工作生活
55较低
工作地点北京,需现场办公,JD未提及弹性或加班情况,生活平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
80较高
AIGC行业处于高速增长期,技术创新驱动,但工作内容偏向商业应用,社会价值中性偏正。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
百度 的其他在招职位
相似职位推荐
Watch Jobs