
希音
算法工程师-AI视觉
算法工程师-AI视觉
发布于 大约 15 小时前普通员工/个人贡献者
广州市
中级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Aigc
Clip
Controlnet
Diffusion
Lora
Pytorch
多模态
计算机视觉
AI 估算 · 25k–50k
结合广州地区硕士3年+算法岗位市场行情及职位技能要求(多模态/AIGC),薪资区间在25k-50k,中位数约37.5k。
职位详情
关于这个职位
这是一个聚焦电商商品视觉的算法工程师岗位,负责构建视觉决策体系、多模态大模型和AIGC生成算法,通过模型优化与数据驱动提升商品发品效率和线上转化率
你将参与从模型研发到业务落地的全流程,涉及扩散模型、多模态理解等前沿技术
适合具有计算机视觉和AIGC经验、希望深入电商业务的算法工程师
最低要求
【学历与从业背景】硕士及以上学历,计算机、人工智能、模式识别、数学、自动化等相关专业
年及以上计算机视觉、多模态、AIGC算法研发经验
【技术基础与工程能力】精通Python,熟练使用PyTorch/TensorFlow深度学习框架,熟悉Linux开发环境
具备独立完成模型训练、调参、微调、推理优化、量化蒸馏及线上部署的完整能力
【专业技术能力】扎实掌握计算机视觉基础(目标检测、图像分割、特征提取、视觉编码器等)
深入理解扩散模型、Transformer、CLIP、BLIP、LLaVA等多模态核心架构
精通Stable Diffusion、ControlNet、LoRA、Inpaint等AIGC工具链
熟练掌握多模态建模、图像理解、视觉Embedding、图文检索、召回排序、多目标预估等技术方向,具备完整特征工程、样本构造、模型训练、线上实验落地经验
【业务与综合能力】具备优秀的业务归因能力,可有效处理多维度混杂变量
熟悉B端决策推荐、人机协同、可解释推荐场景,能将算法能力转化为业务可执行策略方案
拥有从数据分析、模型设计、服务上线到效果迭代的全流程系统落地能力
工作职责
【电商商品视觉决策体系搭建】聚焦B端商品发品全链路,构建视觉方案召回、排序与多目标预估模型
融合商品品类、属性、价格、店铺调性、历史数据及视觉特征,建模预测方案采纳率、CTR、CVR、加购率、退货风险等业务指标
输出可解释视觉策略、规则与推荐依据,支撑业务审核、复用与落地
【多模态大模型技术建设】深耕图文理解、跨模态对齐、多模态检索、VQA、视觉语言生成、LLM+视觉融合等方向,打通文本、图像、视频跨模态交互能力
搭建商品图多模态理解体系,精准抽取构图、光影、姿态、风格、材质、色彩、商品占比等核心视觉因子
【AIGC视觉生成算法研发】负责文生图、图生图、图像编辑、局部重绘、高清修复、文生视频、可控生成等全链路视觉生成能力研发与迭代
基于Diffusion、DiT、GAN、VAE等主流模型优化生成效果、稳定性与美学表现,解决细节失真、人脸崩坏、帧间抖动、语义错位等行业痛点
主导LoRA、ControlNet、IP-Adapter等插件开发与提示词工程优化,完成模型微调、训练调优工作
【数据体系与实验评估建设】统筹高质量图文、视频训练数据集的采集、清洗、标注、质量评估,搭建数据闭环支撑模型迭代
搭建算法全维度评估指标体系,设计A/B实验,完成视觉策略效果归因,剥离流量、价格、活动等混杂因素,精准量化视觉方案对发品成功率、线上转化的实际增益
【前沿技术预研与落地】持续跟进CV、多模态、AIGC前沿技术(Flux、视频生成、RLHF/DPO偏好对齐等),开展技术预研、验证与方案落地
完成模型推理加速、量化、蒸馏等性能优化及工程化部署,推动算法能力接入业务系统等商品发品流程,打造策略推荐-业务采纳-效果回收-模型迭代完整业务闭环
【跨团队协同与业务赋能】对接产品、前后端、业务运营团队,将AIGC生图、视觉决策算法落地至智能设计、内容生产、商品发品、视觉营销等业务场景,保障线上服务稳定运行与持续迭代
优先资格
博士学历、拥有CVPR/ICML/NeurIPS/ECCV等顶会论文者加分
AI 洞察
优缺点分析
优点
- 技术前沿性:直接接触多模态大模型、AIGC、扩散模型等最热门方向,积累核心竞争力
- 业务场景扎实:电商商品视觉是核心业务,算法价值立竿见影,容易获得成就感
- 公司平台大:希音作为巨头跨境电商,数据量大、场景丰富,算法落地空间广阔
- 团队成长快:岗位涉及从数据到模型到部署全流程,能快速提升综合能力
- 技术复杂度高:多模态和AIGC领域变化迅速,需持续跟进最新论文和工具
- 跨团队协作要求高:需与产品、运营等多角色沟通,算法落地需平衡各方需求
- 适合对计算机视觉和AIGC有热情、希望在电商场景中快速落地算法、具备较强自驱力和工程能力的求职者
缺点 / 挑战
- 工作强度可能较高:电商业务节奏快,算法迭代频繁,需应对线上效果波动
角色解读
- 技术纵深:从视觉算法工程师成长为多模态/AIGC领域专家,主导前沿技术预研
- 业务横向:向算法团队负责人或技术经理发展,统筹视觉决策体系全局
- 跨界融合:结合电商业务理解,转向技术产品经理或解决方案架构师角色
- 搭建电商商品视觉决策体系,构建多目标预估模型预测视觉方案效果并输出可解释策略
- 研发多模态大模型,深入图文理解、跨模态对齐、视觉语言生成等方向
- 开发AIGC视觉生成算法,优化文生图、图生图、视频生成等全链路能力
- 搭建数据闭环和评估体系,设计A/B实验量化视觉方案对业务指标的增益
- 精通Python和PyTorch/TensorFlow,具备独立模型训练、调优和部署能力
- 扎实掌握计算机视觉基础(目标检测、分割、特征提取)和多模态架构(CLIP、BLIP等)
- 深入理解扩散模型和AIGC工具链(Stable Diffusion、ControlNet、LoRA)
- 具备业务归因和全流程系统落地能力,能将算法转化为可执行业务策略
申请策略
- 面试中准备一个从0到1的算法落地案例,详细说明技术选型、实验过程和业务收益
- 关注希音公司技术博客或行业分享,了解其技术栈和业务方向,体现主动研究
- 突出多模态/AIGC相关项目经验,尤其是扩散模型、Stable Diffusion微调或ControlNet应用
- 量化算法对业务指标的提升(如CTR、CVR、发品效率等),用数据证明产出
- 展示全流程能力:从数据处理、模型训练到线上部署的完整项目闭环
- 如有顶会论文或开源项目贡献,务必重点标注
- 提前复习扩散模型原理(DDPM、DDIM、Classifier-Free Guidance)和CLIP/LLaVA架构
- 动手复现LoRA、ControlNet等插件,熟悉提示词工程和模型微调技巧
面试指南
- 对于项目介绍类问题,遵循STAR法则:背景、目标、行动、结果,突出技术细节和量化收益
- 对于原理性问题,先给出核心概念的定义,再分步骤解释流程,最后举例说明应用场景
- 请详细介绍你做过的一个多模态或AIGC项目,包括模型选择、训练过程、效果评估和业务落地
- 如何衡量电商商品视觉方案的效果?请设计一个A/B实验方案,并说明如何排除混杂因素
- 扩散模型的基本原理是什么?如何通过ControlNet控制生成图像的结构?
- 你如何处理生成图像中的常见问题(如人脸崩坏、细节失真)?请结合经验说明
- 在多模态模型中,图文对齐是如何实现的?CLIP的训练目标和损失函数是什么?
- 复习扩散模型、Transformer、CLIP、BLIP等模型的结构和关键公式,能够手画架构图
职位点评
73
综合评分
前沿技术导向、薪资中上、成长空间大,但工作强度和灵活性一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和前沿方向、对薪资预期合理、能接受一定工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值70
薪资福利
75中等
该职位薪资处于市场中上水平,希音福利齐全,但未明确列出具体福利,补偿性动机满足度较好。
薪资信号未披露(AI估算:25K-50K/月)
成长发展
90较高
职位涉及多模态、AIGC等前沿技术,成长空间大,但JD未明确提及晋升通道或培训计划。
技术前沿前沿/新兴技术
技术栈扩散模型、多模态、AIGC、Stable Diffusion、CLIP、LLaVA
业务类型profit_center
工作生活
50较低
工作地点为广州核心区域,但未提远程或弹性办公,电商行业可能加班较多,生活化动机满足一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
电商行业稳定增长,视觉算法直接提升用户体验和业务效率,社会影响力中性偏正面。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
希音 的其他在招职位
相似职位推荐
Watch Jobs