Xiaomi logo
小米
顶尖实习-语音大模型算法研究员-MiMo

顶尖实习-语音大模型算法研究员-MiMo

发布于 大约 3 小时前

实习/见习

北京市
无经验要求
实习生
仅现场办公
学历未注明
机器学习工程
Moe
Pytorch
分布式训练
多语言
深度学习
语音压缩
语音大模型
预训练

AI 估算 · 7k–12k

顶尖算法实习薪资较高,参考大厂实习生水平。

职位详情

关于这个职位

这是一份小米MiMo团队的顶尖实习岗位,专注于语音大模型的算法研究

你将参与大规模语音预训练、多语言理解、噪声处理和语音压缩等前沿课题,有机会接触百亿级参数模型的训练
适合有顶会论文背景、热爱技术研究的在校学生

最低要求

多篇NLP&语音领域顶会论文发表

工作职责

大规模语音模态预训练:研究如何用千万小时级别语音数据在百亿级别参数模型上进行高效预训练,有效提取与利用通用声学与语义特征,提升语言理解及语音生成的一致性和自然度

多语言语音理解与生成:研究跨语言语音数据的共享表示方法,提升语音模型对多语言、方言的适配能力
噪声环境及复杂声学场景下的处理能力:研究语音大模型在嘈杂、混响、远场等典型场景下的泛化性
探索高效语音信息压缩方法:研究语音模态压缩方法,以实现长时理解,并适配不同类型的设备(云侧和端侧)的部署需求

AI 洞察

优缺点分析

优点

  • 小米平台实力雄厚,提供充足的数据和计算资源支持
  • 团队学术水平高,可学习前沿研究方法,积累顶会论文经验
  • 实习薪资具有竞争力,且有机会获得转正留用
  • 招聘要求高,竞争激烈,需要过硬的论文发表记录
  • 实习时间有限,需要在短期内快速产出成果,节奏较快
  • 适合有扎实研究基础、热爱语音/NLP领域、追求技术突破和学术成就的在校学生

缺点 / 挑战

  • 课题处于语音大模型前沿,研究影响力大,技术挑战高
  • 研究课题难度大,需要投入大量时间和精力,可能面临压力

角色解读

  • 实习表现优秀者可能获得转正机会,成为小米全职算法研究员
  • 在顶尖科研团队中快速成长,未来可成为语音大模型领域的专家
  • 积累前沿研究经验后,也可选择学术界深造或加入其他顶级AI团队
  • 研究大规模语音模态预训练,探索利用千万小时级数据高效训练百亿参数模型的方法
  • 研究多语言语音理解与生成,提升模型对不同语言和方言的适配能力
  • 研究噪声环境和复杂声学场景下的鲁棒性,提升语音模型的泛化能力
  • 探索语音信息压缩方法,实现长时理解并适配云侧和端侧部署
  • 扎实的深度学习和语音/NLP基础,熟悉Transformer等主流模型架构
  • 具备大规模模型训练经验,了解分布式训练、混合精度等优化技术
  • 有顶会论文发表经验,具备独立的科研能力和实验设计能力
  • 熟练掌握Python和PyTorch,有较强的工程实现能力

申请策略

  • 深入了解小米MiMo团队的研究方向,在申请材料中体现对课题的思考
  • 准备一个简短的研究设想或想法,展示你的独立科研潜力
  • 突出你的顶会论文成果,清晰说明研究动机、方法和核心贡献
  • 强调语音或NLP相关的项目经验,特别是大规模模型训练或语音处理案例
  • 展示强大的编程能力和工程能力,如开源项目、代码竞赛或分布式训练实践
  • 提前熟悉语音大模型技术,如Whisper、Qwen-Audio、VALL-E等模型
  • 补充大规模预训练相关知识,包括Scaling Laws、MoE、长上下文优化等

面试指南

  • 采用STAR法则(情境-任务-行动-结果)回答行为类问题,突出个人贡献
  • 对于开放型技术题,先阐述核心思路,再深入技术细节,最后指出潜在挑战和解决方案
  • 请详细介绍你的顶会论文,包括研究动机、方法和关键结果
  • 如何设计一个大规模语音预训练任务?训练数据如何组织?
  • 在嘈杂环境下,如何提升语音模型的鲁棒性?
  • 你对语音信息压缩有什么思路?如何权衡压缩率和性能?
  • 如果使用百亿参数训练语音模型,你会如何设计训练流程和并行策略?
  • 精读语音大模型领域的高引用论文,包括预训练和语音生成方向

职位点评

75
综合评分

顶尖语音大模型研究实习,前沿课题,薪资未披露,高要求高成长。

从学习成长、工作节奏、岗位方向和实习待遇综合评估,方便比较实习机会。

更适合这类人
适合追求技术成长和科研突破、对未来职业发展有明确规划的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展95
工作生活50
使命价值75

薪资福利

70中等

实习薪资属于市场较高水平,但JD未披露具体数字,福利信息也未明确,稳定性一般。

薪资信号未披露(AI估算:7K-12K/月)

成长发展

95较高

该岗位处于语音大模型研究最前沿,涉及百亿模型训练、多语言等硬核技术,成长空间巨大。

技术前沿前沿/新兴技术
技术栈语音预训练、多语言、语音压缩、大模型、预训练、后训练、强化学习、MoE
业务类型ambiguous

工作生活

50较低

JD未提及远程或弹性办公,工作地点在北京,日常工作灵活性一般,WLB信号不明。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

75中等

语音大模型是AI核心方向,对智能交互、无障碍服务等有重要价值,行业前景广阔。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs