
智谱
AI院--多模态团队--多模态生成算法研究员
AI院--多模态团队--多模态生成算法研究员
发布于 4 个月前普通员工/个人贡献者
北京市
初级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Megatron
Moe架构
图像生成
多模态大模型
多模态生成
并行训练
强化学习
视频生成
PyTorch
AI 估算 · 30k–50k
该职位聚焦前沿AI生成技术,对算法和工程能力要求高,且位于北京,市场竞争力强,薪资水平通常处于行业高位。
职位详情
关于这个职位
该职位是智谱AI院多模态团队的多模态生成算法研究员,主要负责图像和视频生成模型的训练与数据优化工作
你将加入一个全球领先的多模态研究团队,参与前沿生成模型(如GLM-Image、CogVideo)的研发,致力于推动视觉语言大模型在认知与推理能力上的突破
最低要求
高校计算机、电子、自动化等相关专业硕士或博士学位(优秀本科生亦可考虑)
深入理解常用多模态算法
具备多模态大模型和视频理解相关项目经验者优先
在CCF-A类会议发表过多模态相关论文者优先考虑
熟练运用Pytorch、transformers、megatron等主流框架
工作态度认真负责,具备良好的团队协作能力
工作职责
负责图像/视频生成模型训练及数据优化
优先资格
在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先
熟悉并行训练框架,有多机多卡训练经验者优先
AI 洞察
优缺点分析
优点
- 技术前沿性高:直接参与全球领先的多模态生成模型研发,接触GLM-4.5V、GLM-Image等最前沿技术,技能积累价值大
- 平台资源优越:依托智谱强大的计算资源和全栈自研体系,有充足的机会进行大规模模型训练和技术探索
- 行业前景广阔:多模态生成是AI核心赛道,处于高速发展期,职业发展空间和行业需求持续旺盛
- 团队实力强劲:加入全球领先的研究团队,能与顶尖同行共事,获得宝贵的学术与工程经验
- 竞争激烈:该领域汇聚了大量顶尖人才,对个人技术深度、创新能力和产出效率要求极高
缺点 / 挑战
- 技术难度大:多模态生成涉及复杂的模型架构和训练策略,需要持续学习并解决前沿技术难题,工作压力不小
- 工作强度可能较高:前沿研发往往伴随紧张的项目周期和迭代压力,需要投入大量时间和精力
- 该职位适合对多模态生成技术有浓厚兴趣、具备扎实算法和工程基础、追求技术前沿并愿意接受挑战的硕士或博士毕业生
角色解读
- 技术深度上,可以从算法研究员成长为领域专家,主导更复杂的生成模型研发项目,或在特定子方向(如视频生成、3D生成)建立技术壁垒
- 职业广度上,有机会向技术管理(如团队负责人)或技术产品化方向拓展,将前沿研究成果转化为实际可用的产品或解决方案
- 行业影响力上,通过在顶级会议发表论文、参与开源项目,可以建立个人在AI生成领域的声誉和影响力
- 你将负责图像和视频生成模型的训练全流程,包括模型架构设计、数据准备、训练策略优化和性能调优
- 你需要对生成模型的数据进行优化,例如构建高质量的训练数据集、设计数据增强策略,以提升模型的生成质量和泛化能力
- 你将参与团队前沿生成模型(如GLM-Image, CogVideo)的研发与迭代,探索新的模型架构(如自回归+扩散混合架构)和训练方法(如课程采样强化学习)
- 需要深入掌握多模态生成算法,熟悉扩散模型、自回归模型等主流生成技术,并具备扎实的深度学习理论基础
- 必须熟练使用PyTorch、transformers、megatron等主流深度学习框架,具备模型训练、调试和优化的实战能力
- 最好具备多模态大模型或视频理解相关的项目经验,能够处理复杂的多模态数据并理解其内在关联
- 加分项包括在顶级AI会议(如NeurIPS, ICLR)发表论文的经验,以及熟悉多机多卡并行训练框架
申请策略
- 深入了解智谱已发布的GLM系列多模态模型(如GLM-4.5V, GLM-Image)的技术特点和性能,在申请中体现你对公司技术的关注
- 关注团队的研究方向和最新动态,思考你的技能和研究兴趣如何与团队目标相结合,并在沟通中清晰表达
- 重点突出与多模态生成、图像/视频理解相关的项目经历,详细描述你在其中承担的角色、使用的技术栈和取得的量化成果
- 清晰列出你掌握的深度学习框架(PyTorch, transformers等)和并行训练经验,并附上相关的GitHub项目链接或技术博客
- 如果在CCF-A类或国际顶级会议(ACL, NeurIPS等)发表过论文,务必在简历中显著位置列出论文标题、会议和你的贡献
- 强调你的学术背景(985高校相关专业)和任何与多模态大模型相关的实习或研究经历
- 如果缺乏多机多卡训练经验,可以提前学习Megatron-LM、DeepSpeed等并行训练框架的原理和使用方法
- 加强对最新多模态生成论文(如Stable Diffusion 3, Sora技术报告)的研读,理解其核心思想和技术细节
面试指南
- 对于项目经历类问题,建议采用STAR法则(情境、任务、行动、结果)结构化回答,重点突出你的技术决策、动手能力和问题解决过程
- 对于技术原理类问题,应先清晰阐述基本概念,再结合具体模型或论文案例进行深入分析,最后可以联系实际应用或潜在挑战
- 对于工程实践类问题,应展示你系统化的排查思路(如数据、模型、训练配置)、常用的调试工具和方法,以及从失败中学习的经验
- 请详细介绍你过去参与的一个多模态生成或理解项目,包括技术难点和你的解决方案
- 你如何理解扩散模型和自回归模型在图像生成中的优劣?GLM-Image采用的混合架构有什么优势?
- 如果训练一个大型视频生成模型时出现模式崩溃或训练不稳定,你会如何排查和解决?
- 请谈谈你对多模态大模型(如GLM-4.5V的MoE架构)中某个技术细节的理解
- 你是否有使用megatron或类似框架进行多机多卡训练的经验?遇到过什么挑战?
职位点评
81
综合评分
顶尖AI公司前沿技术岗,成长性极佳,薪资竞争力强,但WLB可能需平衡。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
最适合技术驱动、渴望在最前沿AI领域快速成长、追求技术成就感和行业影响力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展95
工作生活60
使命价值90
薪资福利
80较高
薪资预计具备较强市场竞争力,但具体数额未披露,需通过面试洽谈确认。
薪资信号未披露(AI估算:30K-50K/月)
成长发展
95较高
该职位处于AI最前沿,技术成长性极佳,团队实力雄厚,是快速提升技术深度的理想平台。
技术前沿前沿/新兴技术
技术栈多模态生成、图像生成、视频生成、PyTorch、transformers、megatron、并行训练、多模态大模型、强化学习、MoE架构
业务类型profit_center
工作生活
60中等
工作地点固定在北京,办公模式未明确说明弹性,且前沿研发工作可能伴随较高强度。
工作模式未明确
办公地点未明确
加班情况未提及(无法判断)
使命价值
90较高
致力于推动多模态AI认知突破,研发前沿生成模型,在高速增长的AI赛道创造技术影响力,意义感强。
行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号推动视觉语言大模型的认知与推理能力的突破、持续引领行业创新、克服了海报、PPT、科普图等知识密集型场景生成难题
创新程度开拓性创新(行业首创)
智谱 的其他在招职位
相似职位推荐
Watch Jobs