
哔哩哔哩
语音算法工程师(ASR方向)【2027届】
语音算法工程师(ASR方向)【2027届】
发布于 大约 14 小时前普通员工/个人贡献者
上海市
无经验要求
全职员工
仅现场办公
本科
机器学习工程
Asr
多模态
大模型
强化学习
深度学习
端到端语音交互
语音翻译
语音识别
AI 估算 · 25k–40k
上海大厂算法岗,AI方向应届生起薪较高,薪资福利优厚。
职位详情
关于这个职位
该职位负责音频大模型研发,聚焦语音识别、语音翻译和端到端语音对话模型,并探索强化学习在语音模型中的应用
你将与B站技术团队合作,推动技术在视频理解、字幕、搜索等场景落地
适合对语音AI前沿技术有热情的应届生
最低要求
届应届毕业生,计算机科学、人工智能等相关专业本科及以上学历,具备扎实的机器学习、深度学习理论基础
有语音大模型相关前沿技术研究及发表论文经验,理解语音/多模态模型的原理,熟悉大模型底层技术,敢于挑战技术边界
工作职责
负责音频相关大模型研发,包括音频理解(语音识别、语音翻译等)、语音对话模型等方向
跟进前沿语音技术、行业动态及主流模型框架,开展相关学术研究并发表高水平论文
研究强化学习在语音大模型场景中的应用,探索面向主观偏好的奖励建模、偏好对齐及策略优化技术
研究端到端实时语音交互技术,解决语音理解、语音翻译及对话中的关键技术问题
推动相关技术在B站视频理解、字幕、搜索及创作等场景中的落地
优先资格
对端到端语音交互技术有深刻理解,跨语言语音处理技术有实际研究和开发背景,熟悉相关模型和技术栈者优先
有 ACM/ICPC、Kaggle 等编程竞赛获奖经历,或 GitHub 开源项目具有较大影响力者优先
InterSpeech、ICASSP、NeurIPS、ICML、ACL 等语音或 AI 顶会/顶刊发表过相关论文者优先
熟练使用AI agent能力者优先
AI 洞察
优缺点分析
优点
- 处于AI大模型前沿赛道,技术成长空间大,能接触到最先进的语音模型
- 哔哩哔哩作为大型互联网平台,拥有丰富的数据和应用场景,落地机会多
- 鼓励发表论文,适合学术型人才积累科研成果
- 语音大模型研究难度大,对数学和工程能力要求高
- 大厂算法岗竞争激烈,需要持续学习和快速迭代
- 适合对语音AI有浓厚兴趣、具备扎实理论基础和科研经验、渴望在技术前沿不断突破的应届毕业生
缺点 / 挑战
- 薪资水平较高,大厂福利完善
- 未明确WLB,可能存在较大工作压力和加班情况
角色解读
- 从算法工程师成长为语音大模型专家,在ASR、多模态方向深耕
- 可转向技术Leader或技术架构师路线,负责核心系统设计
- 依托B站业务场景,有机会将研究成果快速产品化,获得高影响力
- 研发音频大模型,包括语音识别、语音翻译、语音对话等核心方向,推动技术落地
- 跟踪前沿语音技术和主流模型框架,撰写学术论文并参与顶会交流
- 探索强化学习在语音场景的应用,如偏好对齐、奖励建模和策略优化
- 研究和优化端到端实时语音交互技术,解决实际问题并应用于B站业务
- 扎实的机器学习和深度学习理论基础,熟悉Transformer、Attention等模型结构
- 熟悉语音/多模态大模型原理,具备语音识别或语音交互的实践经验
- 具备一定的科研能力,能独立完成实验设计、结果分析和论文写作
- 对强化学习或AI Agent工具有了解,能快速学习并应用新技术
申请策略
- 了解B站视频内容生态,结合字幕、搜索等场景思考语音技术的应用
- 提前准备一段自我介绍,重点突出你的研究兴趣与岗位的契合度
- 重点突出语音相关项目经验或论文成果,尤其是语音识别、大模型方向的经历
- 展示编程竞赛获奖、开源项目贡献或顶会论文,体现算法与工程能力
- 在简历中明确列出掌握的深度学习框架(如PyTorch)和模型调优经验
- 如有强化学习或Agent项目,可单独说明,加分项
- 系统学习语音大模型主流框架,如Whisper、Qwen-Audio等,并进行实验
- 补充强化学习知识,重点了解RLHF、PPO等偏好优化方法
面试指南
- 用STAR原则描述项目:情境(Situation)、任务(Task)、行动(Action)、结果(Result),突出个人贡献和量化成果
- 对于算法设计类问题,先阐述问题定义,再给出技术选型动机,最后说明评估方法与预期效果
- 结合前沿文献和实际经验,展示你对技术趋势的理解,并提供合理的初步方案
- 请介绍你在语音识别或大模型方面最熟悉的一个项目,技术难点是什么?
- 如何设计一个语音对话模型的强化学习奖励函数?
- 你如何看待端到端语音识别与传统混合模型的区别与优劣?
- 请解释Transformer中的自注意力机制,并说明其在语音建模中的应用
- 如果让你在B站落地语音技术,你会优先选择哪个场景?为什么?
职位点评
71
综合评分
一线大厂算法岗,前沿语音大模型技术,薪资优厚但WLB不明确
从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。
更适合这类人
适合追求前沿技术成长、渴望在语音AI领域深入发展的应届生,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值70
薪资福利
70中等
上海头部互联网公司,薪资水平通常较高,虽未在JD中披露具体数字,但整体补偿性较强。
薪资信号未披露(AI估算:25K-40K/月)
成长发展
85较高
岗位涉及语音大模型、强化学习等前沿技术,有充分的技术成长空间和论文发表机会。
技术前沿前沿/新兴技术
技术栈ASR、语音大模型、强化学习、端到端、多模态
业务类型ambiguous
工作生活
50较低
工作地点在上海,办公模式未明确,未提及WLB相关安排,可能需要适应高强度研发节奏。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
70中等
技术将落地于B站视频理解、字幕等场景,对提升用户体验有直接价值,但社会影响力相对中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
哔哩哔哩 的其他在招职位
相似职位推荐
Watch Jobs