Shein logo
希音
算法工程师-AI视觉

算法工程师-AI视觉

发布于 大约 15 小时前

普通员工/个人贡献者

广州市
中级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Aigc
Clip
Controlnet
Diffusion
Lora
Pytorch
多模态
计算机视觉

AI 估算 · 25k–50k

结合广州地区硕士3年+算法岗位市场行情及职位技能要求(多模态/AIGC),薪资区间在25k-50k,中位数约37.5k。

职位详情

关于这个职位

这是一个聚焦电商商品视觉的算法工程师岗位,负责构建视觉决策体系、多模态大模型和AIGC生成算法,通过模型优化与数据驱动提升商品发品效率和线上转化率

你将参与从模型研发到业务落地的全流程,涉及扩散模型、多模态理解等前沿技术
适合具有计算机视觉和AIGC经验、希望深入电商业务的算法工程师

最低要求

【学历与从业背景】硕士及以上学历,计算机、人工智能、模式识别、数学、自动化等相关专业

年及以上计算机视觉、多模态、AIGC算法研发经验
【技术基础与工程能力】精通Python,熟练使用PyTorch/TensorFlow深度学习框架,熟悉Linux开发环境
具备独立完成模型训练、调参、微调、推理优化、量化蒸馏及线上部署的完整能力
【专业技术能力】扎实掌握计算机视觉基础(目标检测、图像分割、特征提取、视觉编码器等)
深入理解扩散模型、Transformer、CLIP、BLIP、LLaVA等多模态核心架构
精通Stable Diffusion、ControlNet、LoRA、Inpaint等AIGC工具链
熟练掌握多模态建模、图像理解、视觉Embedding、图文检索、召回排序、多目标预估等技术方向,具备完整特征工程、样本构造、模型训练、线上实验落地经验
【业务与综合能力】具备优秀的业务归因能力,可有效处理多维度混杂变量
熟悉B端决策推荐、人机协同、可解释推荐场景,能将算法能力转化为业务可执行策略方案
拥有从数据分析、模型设计、服务上线到效果迭代的全流程系统落地能力

工作职责

【电商商品视觉决策体系搭建】聚焦B端商品发品全链路,构建视觉方案召回、排序与多目标预估模型

融合商品品类、属性、价格、店铺调性、历史数据及视觉特征,建模预测方案采纳率、CTR、CVR、加购率、退货风险等业务指标
输出可解释视觉策略、规则与推荐依据,支撑业务审核、复用与落地
【多模态大模型技术建设】深耕图文理解、跨模态对齐、多模态检索、VQA、视觉语言生成、LLM+视觉融合等方向,打通文本、图像、视频跨模态交互能力
搭建商品图多模态理解体系,精准抽取构图、光影、姿态、风格、材质、色彩、商品占比等核心视觉因子
【AIGC视觉生成算法研发】负责文生图、图生图、图像编辑、局部重绘、高清修复、文生视频、可控生成等全链路视觉生成能力研发与迭代
基于Diffusion、DiT、GAN、VAE等主流模型优化生成效果、稳定性与美学表现,解决细节失真、人脸崩坏、帧间抖动、语义错位等行业痛点
主导LoRA、ControlNet、IP-Adapter等插件开发与提示词工程优化,完成模型微调、训练调优工作
【数据体系与实验评估建设】统筹高质量图文、视频训练数据集的采集、清洗、标注、质量评估,搭建数据闭环支撑模型迭代
搭建算法全维度评估指标体系,设计A/B实验,完成视觉策略效果归因,剥离流量、价格、活动等混杂因素,精准量化视觉方案对发品成功率、线上转化的实际增益
【前沿技术预研与落地】持续跟进CV、多模态、AIGC前沿技术(Flux、视频生成、RLHF/DPO偏好对齐等),开展技术预研、验证与方案落地
完成模型推理加速、量化、蒸馏等性能优化及工程化部署,推动算法能力接入业务系统等商品发品流程,打造策略推荐-业务采纳-效果回收-模型迭代完整业务闭环
【跨团队协同与业务赋能】对接产品、前后端、业务运营团队,将AIGC生图、视觉决策算法落地至智能设计、内容生产、商品发品、视觉营销等业务场景,保障线上服务稳定运行与持续迭代

优先资格

博士学历、拥有CVPR/ICML/NeurIPS/ECCV等顶会论文者加分

AI 洞察

优缺点分析

优点

  • 技术前沿性:直接接触多模态大模型、AIGC、扩散模型等最热门方向,积累核心竞争力
  • 业务场景扎实:电商商品视觉是核心业务,算法价值立竿见影,容易获得成就感
  • 公司平台大:希音作为巨头跨境电商,数据量大、场景丰富,算法落地空间广阔
  • 团队成长快:岗位涉及从数据到模型到部署全流程,能快速提升综合能力
  • 技术复杂度高:多模态和AIGC领域变化迅速,需持续跟进最新论文和工具
  • 跨团队协作要求高:需与产品、运营等多角色沟通,算法落地需平衡各方需求
  • 适合对计算机视觉和AIGC有热情、希望在电商场景中快速落地算法、具备较强自驱力和工程能力的求职者

缺点 / 挑战

  • 工作强度可能较高:电商业务节奏快,算法迭代频繁,需应对线上效果波动

角色解读

  • 技术纵深:从视觉算法工程师成长为多模态/AIGC领域专家,主导前沿技术预研
  • 业务横向:向算法团队负责人或技术经理发展,统筹视觉决策体系全局
  • 跨界融合:结合电商业务理解,转向技术产品经理或解决方案架构师角色
  • 搭建电商商品视觉决策体系,构建多目标预估模型预测视觉方案效果并输出可解释策略
  • 研发多模态大模型,深入图文理解、跨模态对齐、视觉语言生成等方向
  • 开发AIGC视觉生成算法,优化文生图、图生图、视频生成等全链路能力
  • 搭建数据闭环和评估体系,设计A/B实验量化视觉方案对业务指标的增益
  • 精通Python和PyTorch/TensorFlow,具备独立模型训练、调优和部署能力
  • 扎实掌握计算机视觉基础(目标检测、分割、特征提取)和多模态架构(CLIP、BLIP等)
  • 深入理解扩散模型和AIGC工具链(Stable Diffusion、ControlNet、LoRA)
  • 具备业务归因和全流程系统落地能力,能将算法转化为可执行业务策略

申请策略

  • 面试中准备一个从0到1的算法落地案例,详细说明技术选型、实验过程和业务收益
  • 关注希音公司技术博客或行业分享,了解其技术栈和业务方向,体现主动研究
  • 突出多模态/AIGC相关项目经验,尤其是扩散模型、Stable Diffusion微调或ControlNet应用
  • 量化算法对业务指标的提升(如CTR、CVR、发品效率等),用数据证明产出
  • 展示全流程能力:从数据处理、模型训练到线上部署的完整项目闭环
  • 如有顶会论文或开源项目贡献,务必重点标注
  • 提前复习扩散模型原理(DDPM、DDIM、Classifier-Free Guidance)和CLIP/LLaVA架构
  • 动手复现LoRA、ControlNet等插件,熟悉提示词工程和模型微调技巧

面试指南

  • 对于项目介绍类问题,遵循STAR法则:背景、目标、行动、结果,突出技术细节和量化收益
  • 对于原理性问题,先给出核心概念的定义,再分步骤解释流程,最后举例说明应用场景
  • 请详细介绍你做过的一个多模态或AIGC项目,包括模型选择、训练过程、效果评估和业务落地
  • 如何衡量电商商品视觉方案的效果?请设计一个A/B实验方案,并说明如何排除混杂因素
  • 扩散模型的基本原理是什么?如何通过ControlNet控制生成图像的结构?
  • 你如何处理生成图像中的常见问题(如人脸崩坏、细节失真)?请结合经验说明
  • 在多模态模型中,图文对齐是如何实现的?CLIP的训练目标和损失函数是什么?
  • 复习扩散模型、Transformer、CLIP、BLIP等模型的结构和关键公式,能够手画架构图

职位点评

73
综合评分

前沿技术导向、薪资中上、成长空间大,但工作强度和灵活性一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术成长和前沿方向、对薪资预期合理、能接受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值70

薪资福利

75中等

该职位薪资处于市场中上水平,希音福利齐全,但未明确列出具体福利,补偿性动机满足度较好。

薪资信号未披露(AI估算:25K-50K/月)

成长发展

90较高

职位涉及多模态、AIGC等前沿技术,成长空间大,但JD未明确提及晋升通道或培训计划。

技术前沿前沿/新兴技术
技术栈扩散模型、多模态、AIGC、Stable Diffusion、CLIP、LLaVA
业务类型profit_center

工作生活

50较低

工作地点为广州核心区域,但未提远程或弹性办公,电商行业可能加班较多,生活化动机满足一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

电商行业稳定增长,视觉算法直接提升用户体验和业务效率,社会影响力中性偏正面。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs