ByteDance logo
字节跳动
语音算法工程师(多模态理解大模型-说话人方向)-Data语音

语音算法工程师(多模态理解大模型-说话人方向)-Data语音

发布于 大约 8 小时前

普通员工/个人贡献者

北京市
中级经验
全职员工
仅现场办公
学历未注明
机器学习工程
Alm
多模态
大模型
语音识别
说话人日志
说话人聚类
说话人识别

AI 估算 · 35k–70k

语音大模型为前沿方向,人才稀缺,字节薪资竞争力强,结合北京水平,月薪约35-70k。

职位详情

关于这个职位

该职位负责多模态音频理解大模型中说话人相关能力的建设,包括说话人聚类、日志、识别等技术的优化与落地

你将深度参与下一代多模态音频理解基座模型的构建,紧跟业界前沿算法
适合具备语音技术和深度学习经验、喜欢挑战技术难题的算法工程师

最低要求

理解说话人聚类、说话人日志、说话人识别等相关任务的技术实现,对业务效果优化有实际经验

熟悉语音识别、音频caption、语音对话等技术,了解音视频多模态理解相关技术
对深度学习和大模型技术有较好的理解,如AHC、ResNet、EcapaTDNN、ALM和LLM等系列模型架构
对工业级数据的处理管线有实际经验,有使用海量数据优化实际业务模型的动手经验
有不错的编码能力,熟悉Codex、TRAE等Code Agent,熟悉C++、Python等常用编程语言
有独立工作能力并同时能与团队融洽协作,敢于发现和提出问题

工作职责

负责多模态音频理解大模型(ALM)后训练中说话人相关能力的建设,并结合其它语音理解任务落地场景,解决落地过程中的问题,持续优化技术效果

深度参与下一代多模态音频理解基座模型的核心技术构建,持续跟进并攻克说话人相关的技术难题,探索追求业界算法

优先资格

在会议和智能硬件等场景有的说话人日志或语音识别系统落地和优化经验

对前沿的端到端说话人日志有优化经验或在GitHub上有相关技术的开源项目
在相关国际会议或主流期刊上发表论文(ICASSP、Interspeech、ASRU、IEEE/ACM Transactions等)
语音相关比赛或机器学习相关比赛拿到过国际领先名次,具备ACM/NOI/IOI/TopCoder等编程比赛获奖经历

AI 洞察

优缺点分析

优点

  • 字节跳动作为头部大厂,拥有丰富的算力和数据资源,能接触最前沿的大模型技术
  • 语音大模型是当前AI热点,职业发展空间大,跳槽竞争力强
  • 团队技术氛围浓厚,与优秀同事共事,个人成长迅速
  • 互联网节奏快,可能存在高强度加班,工作生活平衡较难保证
  • 业务需求多变,需要快速适应和迭代,有一定不确定性

缺点 / 挑战

  • 技术难度高,需同时具备算法深度和工程能力,学习压力大
  • 适合对语音技术有热情、具备扎实算法功底、乐于挑战前沿难题的工程师

角色解读

  • 成为多模态音频理解领域的技术专家,主导关键算法的研发与创新
  • 可向技术管理方向发展,带领团队完成复杂项目
  • 有平台和资源支持发表顶尖会议论文,提升个人影响力
  • 负责多模态音频理解大模型中说话人相关能力的建设,包括说话人识别、聚类和日志等任务
  • 结合具体业务场景(如会议、智能硬件)优化技术效果,解决落地中的实际问题
  • 深度参与下一代音频理解基座模型的技术构建,持续攻克说话人技术难题
  • 与团队协作,推动技术迭代和创新,输出高质量算法方案
  • 掌握说话人聚类、日志、识别等核心技术,具备实际业务效果优化经验
  • 熟悉语音识别、音频caption、语音对话及多模态理解技术
  • 对深度学习和大模型架构有深入理解,熟悉AHC、ResNet、EcapaTDNN、ALM、LLM等模型
  • 具备工业级数据处理能力,熟悉Python/C++,能使用Code Agent工具提升开发效率

申请策略

  • 了解字节语音团队的技术方向和产品,准备针对性问题
  • 在面试中多展示独立思考和解决问题的能力,而不只是结果
  • 突出说话人相关项目的实际成果,量化性能提升(如准确率、聚类纯度等)
  • 详细描述在大模型或多模态方向的实践经历,体现对ALM/LLM的理解
  • 展示编程能力,如用Python/C++完成高效数据处理或模型推理
  • 如有论文或国际竞赛获奖,置于显眼位置
  • 深入学习ALM、LLM等最新多模态大模型的结构和训练方法
  • 熟悉Codex、TRAE等AI辅助编码工具,提高开发效率

面试指南

  • 回答项目类问题时,采用STAR法则(情境-任务-行动-结果),突出你的角色和量化成果
  • 对于技术理解题,先讲清基础原理,再结合最新研究动态,展示学习能力
  • 对于开放性问题,可以给出思考框架,先拆解问题,再提出多种方案和权衡
  • 请详细讲一个你参与过的说话人识别或聚类项目,遇到的最大挑战是什么?如何解决的?
  • 你如何理解ALM和LLM在说话人任务中的优势?目前有哪些技术路线?
  • 在工业级场景下,如何设计一个可扩展的说话人日志系统?
  • 如果你负责的模型在特定场景下效果不佳,你会如何分析和优化?
  • 你对端到端说话人日志有什么了解?与传统方法相比有何优劣?

职位点评

75
综合评分

字节语音算法岗,前沿大模型方向,薪资高成长快,但WLB一般。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适合追求技术成长和事业突破,能够适应高强度工作的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活50
使命价值70

薪资福利

80较高

字节跳动提供业界领先的薪酬和福利,虽JD未披露具体数字,但通常高于市场平均水平。

薪资信号未披露(AI估算:35K-70K/月)

成长发展

90较高

该岗位处于大模型前沿,技术挑战大,成长空间充足,能迅速积累稀缺经验。

技术前沿前沿/新兴技术
技术栈说话人识别、说话人聚类、说话人日志、多模态、ALM、LLM、深度学习、大模型
业务类型ambiguous

工作生活

50较低

工作地点北京,未提及弹性办公,互联网公司通常节奏较快,WLB可能一般。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

70中等

AI大模型是高速增长赛道,创新性强,但社会影响力中性,主要服务商业应用。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs