
阿里巴巴
千问事业部-Omni全模态大模型算法专家-杭州/北京
千问事业部-Omni全模态大模型算法专家-杭州/北京
发布于 大约 14 小时前普通员工/个人贡献者
北京市 / 杭州市
专家级经验
全职员工
仅现场办公
硕士
机器学习工程
Dpo
Pytorch
Rlhf
Sft
多模态模型
大模型后训练
对话系统
评测体系
Online Rl
AI 估算 · 40k–70k
大厂核心算法岗,大模型方向技术壁垒高,市场需求旺盛,薪资竞争力强,通常16薪。
职位详情
关于这个职位
作为阿里千问事业部的Omni全模态大模型算法专家,你将专注于实时音视频通话场景下的多模态模型后训练与优化,推动AI交互从“能回答”迈向“更像真人”
工作涉及SFT、RLHF等前沿技术,需要扎实的机器学习和工程基础,适合热衷于大模型落地和产品体验的算法人才
最低要求
计算机科学、人工智能、机器学习、语音处理或相关领域硕士及以上学历
具备大模型、对话系统、多模态模型或语音交互方向研发经验,对实时对话式 AI 产品有较深理解,具备较强的工程落地与问题抽象能力
在以下一个或多个方向具备扎实经验:大模型后训练与对齐技术(如 SFT、RLHF、RLAIF、DPO、Online RL 等)、Omni/多模态模型训练优化、音视频通话场景下的数据与评测体系建设、聊天/问答/Agent 类场景的模型效果优化
熟悉大模型训练与推理相关技术栈,精通 Python,熟练使用 PyTorch 等主流框架,具备扎实的机器学习、深度学习与 Transformer/多模态模型基础
具备较强的数据与评测意识,能够围绕真实业务问题搭建数据闭环、设计评测方案,并通过系统性实验持续提升模型效果
工作职责
结合实时音视频通话场景中的用户需求与交互特点,定义模型能力目标与体验标准,制定后训练与效果演进方案,持续优化响应速度、表达自然度、理解准确性与任务完成效果
围绕 Omni 多模态模型开展 Post-training 工作,包括 SFT、RL、数据配比优化、训练目标设计与策略迭代,提升模型在多轮对话、上下文理解、情绪感知、口语表达等方面的能力
构建实时 AI 通话场景的数据与评测体系,覆盖聊天、问答、生活服务等核心场景,建设监督数据、偏好数据、强化学习数据及线上回流样本,建立可量化的效果评估标准并驱动持续优化
面向真实产品链路中的复杂问题,优化模型在打断恢复、上下文衔接、模糊意图理解、口语化问答、多模态信息融合等场景下的表现,并与产品、工程、语音、评测等团队协同推动落地
AI 洞察
优缺点分析
优点
- 站在大模型前沿,接触Omni多模态、强化学习等先进技术,技术积累极具含金量
- 阿里平台资源丰富,数据规模大,业务影响力广,个人价值能快速放大
- 薪资福利优厚,16薪体系,长期激励可能丰厚
- 工作强度大,互联网大厂节奏快,可能面临频繁迭代和高压交付
- 技术难度高,需要持续学习新知识,竞争激烈,对自身能力要求高
- 跨团队协作多,需要较强的沟通和项目管理能力
缺点 / 挑战
- 适合热爱挑战、追求技术深度、能适应高强度工作节奏,并对大模型落地充满热情的算法工程师
角色解读
- 技术纵深方向:从模型后训练到前沿对齐技术,成为大模型算法领域的资深专家
- 业务影响方向:深入实时交互场景,成长为技术负责人,驱动产品创新
- 横向发展:在阿里内部可转向多模态研究、Agent系统等更多前沿业务
- 负责Omni全模态大模型在实时音视频通话场景中的后训练与优化,包括SFT、RLHF等技术,提升模型交互能力
- 构建数据和评测体系,针对聊天、问答等场景设计标注规范和评估标准,形成数据闭环
- 与产品、工程等团队协作,解决实际问题,如打断恢复、多模态融合等,推动模型落地
- 扎实的深度学习和多模态基础,精通Python和PyTorch
- 熟悉大模型后训练和对齐技术,如SFT、RLHF、DPO、Online RL等
- 具备数据与评测体系建设经验,能设计实验并系统分析结果
- 良好的团队协作和沟通能力,能与多方配合推进项目
申请策略
- 关注阿里巴巴千问事业部的大模型业务,了解Omni模型的进展和应用场景,在面试中展示见解
- 准备一个自己主导的复杂项目,从问题定义、方案设计到实验迭代完整讲清楚
- 突出大模型后训练或对齐项目的实际经验,如做过SFT/RLHF,并量化效果提升
- 强调多模态或语音交互项目经验,体现与岗位的匹配度
- 展示数据闭环和评测体系搭建的完整案例,说明你的数据驱动意识
- 如果熟悉在线强化学习或Agent训练,可以着重突出
- 系统梳理RLHF、DPO、Online RL等最新对齐技术,了解原理和工程实现
- 多练习PyTorch分布式训练,熟悉大规模模型训练常见问题
面试指南
- 使用STAR法则描述项目:情境-任务-行动-结果,突出个人贡献和量化成果
- 从问题本质出发,先讲思路再讲细节,展现系统性和逻辑性
- 结合业务场景,说明技术选型和权衡,体现你的业务敏感度
- 请介绍你在多模态大模型后训练中做过的一个项目,遇到了哪些挑战,如何解决?
- 如何设计一个针对实时对话场景的评测体系?你如何保证评测指标的可靠性?
- 比较SFT、RLHF、DPO的适用场景和优缺点,你如何选择?
- 在模型训练中,如何平衡响应速度、自然度和任务完成效果?
- 如何处理对话中的打断恢复和上下文衔接问题?
职位点评
78
综合评分
阿里大厂核心算法岗,前沿大模型技术栈,薪资优厚,但工作强度大、WLB一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿、渴望快速成长、能应对高强度工作的求职者,最看重技术发展和薪资回报。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活50
使命价值75
薪资福利
85较高
阿里作为大型互联网上市公司,薪资水平和福利待遇在行业内处于前列,补偿性动机满足度较高。
薪资信号未披露(AI估算:40K-70K/月)
成长发展
90较高
该职位聚焦大模型后训练与多模态前沿技术,技术挑战大,学习曲线陡峭,发展空间广阔,是技术进度的理想平台。
技术前沿前沿/新兴技术
技术栈Python、PyTorch、SFT、RLHF、DPO、Online RL、多模态模型、大模型后训练、对话系统
业务类型profit_center
工作生活
50较低
大厂核心业务整体节奏较快,虽然未明确要求加班,但实际工作强度可能较高,生活平衡一般。
工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)
使命价值
75中等
职位参与塑造下一代AI交互形态,技术愿景具有社会影响,但以商业落地为主,意义感属于中等偏上。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
阿里巴巴 的其他在招职位
相似职位推荐
Watch Jobs