Xiaomi logo
小米
视觉生成大模型算法工程师

视觉生成大模型算法工程师

发布于 大约 3 小时前

普通员工/个人贡献者

武汉市
其它
全职员工
仅现场办公
硕士
计算机视觉工程
Pytorch
多模态
大模型
模型优化
深度学习
视觉生成

AI 估算 · 25k–45k

视觉大模型是前沿方向,小米平台好,武汉薪资相对北京上海略低,综合预计25-45k。

职位详情

关于这个职位

该职位负责小米视觉生成大模型算法的研发与应用落地,围绕手机、汽车、小爱等核心业务,参与算法设计、数据构建、模型训练与优化,并探索生成与编辑领域的前沿技术

适合具备扎实深度学习基础和视觉生成经验、对前沿技术有热情的算法工程师

最低要求

计算机、人工智能、机器学习、电子信息、自动化、应用数学等相关方向硕士及以上学历,视觉生成或多模态大模型相关方向

熟练掌握PyTorch等至少一种常用深度学习框架,熟练掌握python、C++等至少一门编程语言,优秀的算法代码开发能力
扎实的视觉生成大模型算法基础,有该领域的算法动手经验,具备跟进领域前沿的能力
责任心强,有良好的沟通协作能力及团队合作精神

工作职责

参与视觉生成与编辑相关的大模型算法应用研发,围绕手机、汽车、小爱等核心业务需求,参与视觉生成算法设计、数据构建、模型训练和优化、效率优化等工作,解决算法落地碰到的技术问题

探索视觉生成与编辑大模型领域前沿,跟进最新技术进展,持续创新,打造有影响力的高水平技术,并推动在核心产品中的应用

优先资格

加分:发表过视觉生成大模型相关的较高水平论文并对论文有实际贡献,或以技术角色参加相关领域主流算法竞赛且取得优秀成绩

AI 洞察

优缺点分析

优点

  • 小米为上市大厂,平台稳定,业务场景丰富,算法可快速落地到手机、汽车等产品
  • 视觉生成大模型是当前AI最热门方向之一,技术成长快,市场需求旺盛
  • 武汉作为新一线城市,生活成本相对低,同时小米在武汉有研发中心
  • 业务落地需要与多方协作,可能涉及非技术性沟通成本
  • 适合有扎实算法基础、对视觉生成充满热情、且希望在大型平台中将技术转化为产品的工程师

缺点 / 挑战

  • 算法岗位竞争激烈,需持续学习紧跟前沿,工作压力较大
  • 大模型训练需要大量计算资源,工作中可能面临资源调度的挑战

角色解读

  • 横向可向多模态大模型、AIGC产品方向拓展,成为领域专家
  • 纵向可晋升为技术骨干或技术负责人,带领团队研发核心算法
  • 在小米可深入业务场景,积累大规模落地经验,未来可跳槽或创业具有竞争力
  • 参与视觉生成与编辑大模型的算法设计、数据构建和模型训练,解决实际业务场景中的技术问题
  • 围绕手机、汽车、小爱等核心产品,推动生成算法在图像编辑、内容创作等场景的落地应用
  • 跟进视觉生成领域的前沿进展,探索创新性算法并评估其应用价值
  • 扎实的深度学习和计算机视觉基础,熟悉生成模型如GAN、Diffusion等
  • 熟练掌握PyTorch等深度学习框架,及Python/C++编程
  • 具备独立动手实现和优化算法模型的能力,能够快速复现和迭代
  • 良好的沟通协作能力,能与跨团队合作推动项目落地

申请策略

  • 了解小米AI相关产品线,思考你的技能如何服务于手机摄影、汽车自动驾驶等场景
  • 准备好展示一个完整的项目案例,从问题定义到最终效果
  • 突出视觉生成相关项目经验,如基于Diffusion或GAN的图像生成/编辑工作
  • 展示论文或竞赛成果,体现算法研究能力
  • 详细描述模型训练优化过程,如加速、调参、解决具体问题
  • 强调Python/PyTorch/C++的扎实编码能力
  • 熟悉最新的扩散模型(如Stable Diffusion, Sora等)原理和实现
  • 了解多模态大模型的应用,如CLIP、LLM与视觉结合

面试指南

  • 用STAR法则描述项目:先交代背景和任务,说明你的具体职责,再讲采取的技术方案和关键决策,最后展示结果和量化指标
  • 对于技术对比问题,从效果、训练难度、推理成本、可控性等维度进行分析,并结合实际应用场景给出选择依据
  • 对于优化问题,先明确瓶颈,再提出针对性的方案,如模型剪枝、量化、蒸馏等,并说明权衡
  • 请详细介绍一个你参与过的视觉生成项目,包括技术选型、模型结构、训练技巧和最终效果
  • 你如何评价最新的扩散模型?与GAN相比有何优劣?在图像编辑上如何选择?
  • 如何优化端侧部署的生成模型,平衡效果和速度?
  • 如果需要在有限的数据下训练一个高质量的生成模型,你会怎么做?
  • 你如何跟进前沿论文?最近关注的视觉生成方向进展有哪些?

职位点评

73
综合评分

小米武汉视觉生成大模型算法岗,前沿技术、平台好,薪资有竞争力但WLB未明确

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
该职位最适合重视技术成长和行业前景的求职者,能接受一定的工作强度。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活60
使命价值75

薪资福利

70中等

小米薪资水平具有竞争力,但JD未披露具体薪资和福利,补偿性动机中等偏上。

薪资信号未披露(AI估算:25K-45K/月)

成长发展

85较高

视觉生成大模型是前沿技术,岗位能够深入核心算法研发,成长空间大,强烈满足发展性动机。

技术前沿前沿/新兴技术
技术栈PyTorch、Python、C++、视觉生成、大模型、多模态、深度学习
业务类型ambiguous

工作生活

60中等

JD未提及工作时间和弹性安排,根据行业惯例可能加班,生活化动机满足有限。

工作模式未明确
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

视觉生成技术应用于核心产品,影响广泛,行业前景好,但社会价值中性。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs