Alibaba logo
阿里巴巴
算法工程师-VLM训练

算法工程师-VLM训练

发布于 大约 3 小时前

普通员工/个人贡献者

北京市 / 杭州市
高级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Moe
Pytorch
Rlhf
Vlm
分布式训练
多模态
大模型
混合精度

AI 估算 · 40k–70k

大厂核心岗位,大模型方向薪资溢价高,16薪制,月薪4-7万。

职位详情

关于这个职位

该职位专注于多模态大模型(VLM)的训练与优化,涉及万卡级GPU集群的分布式训练和前沿技术攻坚

你将参与从预训练到对齐的全链路,推动夸克AI核心产品的多模态能力落地,并有机会发表顶级论文
适合有大模型深度经验、渴望冲击技术极限的算法专家

最低要求

编程实力:精通 Python / C++ 等,熟悉深度学习主流框架(如 PyTorch)、混合精度、分布式训练与部署

多模态功底:在计算机视觉、跨模态理解或通用 AI 领域具备扎实的研究与落地经验
大模型经验:主导或深度参与过 >10B 参数模型的训练 / 推理优化,并产生显著业务影响
科研视野:在 ACL、CVPR、NeurIPS、ICLR 等顶会发表论文者优先
快速迭代:对新技术保持敏锐,能在未知领域迅速学习、实验并产品化
AGI 信仰:对多模态智能与 AGI 未来充满热情和好奇

工作职责

跨模态长程预训练:设计并实现文本、图像、视频等多模态对齐与融合的长程训练策略,操控万卡级 GPU 集群,协同 Pretrain / CPT / SFT / RLVR / RLHF 全链路,对超大参数基座模型进行高效分布式优化

前沿技术攻坚:深入探索 MoE 稀疏化、训练算法与对齐范式创新、可解释性与质量监控、多模态推理、mRAG、百万 Token 级长文处理、Agent&工具链机制等底层原理与技术
高性能训练框架持续升级:与系统团队共建张量并行、流水并行、混合精度等高性能训练框架,持续提升训练吞吐与稳定性
学术与行业影响力打造:快速跟踪 NeurIPS / CVPR / ACL 等顶会成果及开源项目,输出专利与论文,树立行业技术标杆
高速驱动夸克AI相关业务:赋能夸克 AI 相机、AI 搜索·深度思考、DeepResearch、创意写作、AI 助手等核心产品,实现多模态能力的快速迭代与落地

优先资格

在 ACL、CVPR、NeurIPS、ICLR 等顶会发表论文者优先

AI 洞察

优缺点分析

优点

  • 顶级资源:万卡算力和海量数据,与行业专家共事,技术天花板极高
  • 前沿方向:VLM是当前AI最热门赛道,AGI关键路径,行业发展前景广阔
  • 薪酬竞争力强:16薪+大厂福利,薪资水平处于行业顶尖
  • 学术与产业双丰收:可发表顶会论文,同时直接赋能亿级用户产品
  • 技术难度极大:需要同时掌握大规模分布式训练、多模态、强化学习等复杂技术
  • 工作强度可能较大:处于竞争最激烈的AI前沿,需快速迭代和持续学习
  • 适合有大模型训练经验、对AGI充满热情、渴望在技术最前沿攻坚的算法专家

缺点 / 挑战

  • 业务压力:成果需直接落地到产品,面临严格的效果和时效要求

角色解读

  • 技术纵深:从模型训练专家向多模态/AGI领域科学家发展,成为行业技术领袖
  • 管理方向:可转向带领训练团队或算法团队,负责更大规模模型研发
  • 业务影响:深入产品线,成为AI产品技术负责人,驱动核心业务增长
  • 负责设计并实施多模态大模型(VLM)的预训练、微调、对齐等全链路训练策略,操控万卡级GPU集群进行分布式优化
  • 探索MoE稀疏化、多模态推理、长文处理等前沿技术,推动模型能力突破
  • 与系统团队协作升级高性能训练框架,提升训练效率和稳定性
  • 将研究成果快速落地到夸克AI相机、AI搜索等核心产品,实现业务价值
  • 精通Python/C++和PyTorch,熟悉混合精度、分布式训练与部署
  • 扎实的多模态研究或落地经验,包括计算机视觉、跨模态理解等
  • 主导过10B以上参数模型训练或推理优化,有显著业务影响
  • 较强的科研能力,能快速跟踪顶会成果并输出论文专利

申请策略

  • 深入了解夸克AI产品的多模态场景(如AI相机、搜索),在面试中提出具体改进思路
  • 展示对AGI长期信仰和热情,与团队文化契合
  • 突出大模型训练项目经验,尤其是10B以上参数模型的完整流程
  • 强调分布式训练优化成果,如吞吐提升、成本降低等量化指标
  • 列举顶会论文、开源贡献或专利,展示科研影响力
  • 体现多模态相关项目,如跨模态理解、图像生成、视频理解等
  • 补充MoE、RLHF等前沿对齐技术的学习和实践
  • 熟悉万卡集群下的故障处理和调优工具(如Megatron、DeepSpeed)

面试指南

  • 采用STAR法则:情境-任务-行动-结果,量化具体指标
  • 技术问题需结合理论与实践:先阐述原理,再给出自己的实践经验和优化思路
  • 开放性问题:提出多种方案并比较优劣,体现系统思维
  • 请详细描述你主导的10B+参数模型训练过程,包括遇到的挑战和解决方案
  • 如何设计多模态数据的预处理和采样策略以提升模型性能?
  • 深度学习中混合精度训练的原理和注意事项有哪些?
  • 你对MoE稀疏化和RLHF的理解?在实际应用中如何权衡效果和效率?
  • 在万卡级集群上训练时,如何保证稳定性和训练效率?

职位点评

80
综合评分

顶级大厂、前沿VLM技术、高薪高发展,但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和行业前沿、对薪资和发展有高要求,且能接受较大工作强度的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利90
成长发展95
工作生活40
使命价值85

薪资福利

90较高

阿里巴巴是大厂,薪酬福利极具竞争力,16薪制且明确提到'顶尖资源',补偿性动机满足度高。

薪资信号偏高 (40K-70K/月)
福利待遇顶尖资源、极具竞争力的薪酬福利、纯粹的工程师文化

成长发展

95较高

职位处于AI最前沿,涉及VLM、MoE、RLHF等尖端技术,且有明确学术输出要求,成长空间极大。

技术前沿前沿/新兴技术
技术栈VLM、MoE、RLHF、多模态、分布式训练、万卡集群、AGI
成长机会顶尖资源、高速成长、导师制?、职业加速
业务类型profit_center

工作生活

40较低

两个一线城市办公,但未提及远程或弹性工作,大厂算法岗通常加班较多,WLB评分较低。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

85较高

职位致力于AGI关键技术,有明确的社会价值和使命感,且赋能多个核心产品,意义感强。

行业发展高速增长赛道
社会影响正向社会影响力较高
使命信号亲历 AGI 关键技术的诞生与规模化应用、在智能时代留下你的名字
创新程度积极采用新技术
Watch Jobs