
美团
视觉生成基座算法专家
视觉生成基座算法专家
发布于 大约 15 小时前普通员工/个人贡献者
北京市
专家级经验
全职员工
仅现场办公
学历未注明
计算机视觉工程
Autoencoder
Moe
Pytorch
Tokenizer
世界模型
图像生成
扩散模型
自回归模型
视频生成
AI 估算 · 40k–70k
视觉生成算法专家属于高需求前沿技术岗,美团平台大,薪资竞争力强,北京地区资深算法专家月薪一般在4-7万,年终奖约3个月。
职位详情
关于这个职位
作为美团基础研发平台的视觉生成基座算法专家,你将负责构建面向图像、视频及音视频的全模态生成基座模型,探索扩散模型、自回归模型等前沿生成技术,并推动技术落地到实际业务中
该岗位技术挑战大、方向前沿,适合在计算机视觉和深度学习领域有深厚积累、渴望参与大规模模型研发的算法人才
最低要求
熟练掌握模式识别和计算机视觉领域的基础理论和方法,在一个或多个领域有深入研究:扩散模型、图像/视频生成与编辑、跨模态理解与生成、大规模数据处理与训练等
在机器学习和深度学习方面具备扎实的理论基础和工程能力,熟悉Pytorch等主流框架
优秀的分析和解决问题的能力,项目推动力和团队协作能力
工作职责
负责视觉生成基座模型及应用的整体研发工作,面向图像生成、视频生成及音视频生成等全模态生成场景,构建行业先进的通用视觉生成能力
主要工作包括但不限于:
视觉全模态生成基座模型:设计和优化适用于图像、视频、音视频等多模态场景的统一生成基座模型架构
开展多模态、多任务联合训练与对齐(如图文、视听、动作等),提升模型的通用性与泛化能力
针对不同应用场景(如图像视频内容生成与编辑等)进行模型能力扩展与定制化优化
高效图像/视频Autoencoder与Tokenizer:研发高效压缩比、低失真度的图像/视频Autoencoder、Tokenizer等表征模型,支持大规模训练与高吞吐推理
探索适用于长视频、多视角视频等场景的结构化表征方式(如时空Token、分层编码等),平衡压缩率与生成质量
高效生成与下一代生成架构探索:研究和实现高效的生成范式,包括但不限于扩散模型、自回归模型等,并在大规模数据与大模型场景下优化训练与推理效率
探索稀疏架构、MoE(Mixture-of-Experts)等新型大模型结构,提高模型参数利用率与可扩展性
针对不同延迟与成本要求,设计分级推理与加速方案(如多阶段生成、粗到细生成、裁剪与蒸馏等)
面向世界模型(World Model)的长视频与实时生成:探索对复杂时空动态、因果关系与交互逻辑的建模方法,支撑长时长视频、连续场景生成
研发支持长视频叙事、一致角色与连贯环境的生成技术,解决长时依赖建模、记忆与控制等难题
构建低延迟、高稳定性的实时生成方案,支持交互式生成、实时驱动内容(如游戏、虚拟人、直播增强等)应用
AI 洞察
优缺点分析
优点
- 平台技术实力强,有超大规模集群和海量数据资源
- 技术方向前沿,覆盖图像、视频、音频全模态,成长空间大
- 业务场景丰富,技术转化落地机制完善
- 注重创新,技术氛围浓厚,与一流工程师共事
- 技术难度高,需要深入研究复杂模型架构和训练技巧
- 竞争激烈,需要持续学习和保持技术领先
缺点 / 挑战
- 工作强度可能较大,快速迭代和前沿探索压力并存
- 适合在计算机视觉、深度生成模型领域有深厚积累,热爱技术挑战,希望参与大规模模型研究和落地的算法专家
角色解读
- 可在视觉生成领域深入成为技术专家,负责更核心的基座模型研发
- 有机会扩展到多模态、世界模型等更前沿方向,引领技术方向
- 在美团基础研发平台可接触超大规模集群和海量数据,技术视野和影响力快速提升
- 设计和优化图像、视频、音视频等多模态统一生成基座模型架构,开展多任务联合训练与对齐
- 研发高效图像/视频Autoencoder与Tokenizer,支持大规模训练与高吞吐推理
- 探索扩散模型、自回归模型等高效生成范式,并优化训练与推理效率
- 面向世界模型研究长视频生成与实时生成技术,支撑交互式应用
- 扎实的计算机视觉和模式识别理论基础,熟悉扩散模型、图像/视频生成与编辑
- 精通机器学习和深度学习,熟练使用PyTorch等主流框架
- 具备大规模数据处理与训练经验,了解MoE、稀疏架构等前沿模型结构
- 优秀的分析解决问题能力和团队协作能力
申请策略
- 了解美团业务和基础研发平台的技术战略,思考视觉生成如何赋能本地商业
- 准备好展示你有影响力的技术作品,并清晰阐述技术思路和决策依据
- 突出在扩散模型、图像/视频生成方面的具体项目经验和成果,如论文、开源项目或工业落地案例
- 强调大规模模型训练经验,包括分布式训练、数据管线、调优技巧等
- 展示对Autoencoder、Tokenizer、MoE等技术的理解和实践
- 提及解决问题的能力,例如如何突破生成质量、效率瓶颈
- 补充世界模型、长视频生成等前沿方向的知识
- 深入学习模型压缩、蒸馏、高效推理等工程优化技术
面试指南
- 用STAR法则组织项目经历,突出你个人的贡献和量化结果
- 回答技术选型问题时,从任务目标、数据规模、算力约束等维度分析,体现系统性思考
- 对于开放性设计问题,先明确关键挑战,再给出分步解决方案,并说明权衡
- 请介绍你参与过的视觉生成项目,核心难点和解决方案是什么?
- 如何设计一个统一的多模态生成基座模型?谈谈你的架构思路
- 扩散模型和自回归模型各自的优缺点?在视频生成中你会怎么选?
- 如何平衡生成质量和推理效率?你有哪些实践经验?
- 你对世界模型的理解?如何解决长视频生成中的时空一致性问题?
职位点评
76
综合评分
美团前沿视觉生成算法岗,技术含量高、成长空间大,薪资优厚但工作强度可能较高。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求前沿技术成长、热爱挑战、以事业成就为核心驱动力的算法专家,不太适合追求工作生活平衡的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利78
成长发展95
工作生活50
使命价值72
薪资福利
78中等
JD未明确薪资福利,但美团作为大型互联网上市公司,薪酬体系成熟,算法专家岗位薪资有竞争力。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
95较高
岗位聚焦视觉生成前沿技术,涉及扩散模型、世界模型、MoE等,技术成长空间巨大,且美团提供完善的学习生态和落地机制。
技术前沿前沿/新兴技术
技术栈扩散模型、自回归模型、MoE、视觉生成、世界模型、PyTorch、Autoencoder、Tokenizer
成长机会超强的技术氛围、完善的技术转化和落地机制、注重技术创新、完善的互联网学习生态圈、非线性成长
业务类型ambiguous
工作生活
50较低
工作地点在北京,需现场办公,JD未提及弹性或远程,互联网大厂算法岗通常工作强度较大,WLB平衡一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
72中等
视觉生成技术有广阔应用前景,美团通过技术创新驱动行业价值,岗位对社会有一定贡献,但更偏商业驱动。
行业发展稳定成熟行业
社会影响中性/一般
使命信号驱动技术发展、创造行业价值
创新程度积极采用新技术
美团 的其他在招职位
相似职位推荐
Watch Jobs