JD logo
京东
算法工程师-语音/音频大模型

算法工程师-语音/音频大模型

发布于 大约 14 小时前

普通员工/个人贡献者

北京市
无经验要求
全职员工
仅现场办公
本科
研究与开发 (研发)
Icassp
Interspeech
声纹识别
大模型
机器学习
深度学习
语音合成
语音识别

AI 估算 · 20k–30k

京东校招算法岗薪资在业内属于中上水平,语音大模型方向技术门槛高,且北京生活成本较高,综合评定月薪范围合理。

职位详情

关于这个职位

该职位是京东语音/音频大模型方向的算法工程师,主要负责语音识别、合成、声纹识别等核心算法的研发与落地,并将前沿AI技术应用于京东实际业务场景

作为应届生岗位,你将有机会参与大模型驱动的语音技术探索,积累工业级项目经验

最低要求

10月1日至2027年9月30日期间毕业,统招本科及以上学历

数学、计算机等相关专业优先
工程基础能力扎实,熟练掌握Python和C++
对机器学习、深度学习算法具备扎实的知识基础,并有项目实践尝试,熟练掌握算法流程和数据处理方法
语音识别、语音合成相关专业,或有相关项目经验者优先,或者有兴趣从事这个领域技术工作并具有优秀的学习能力
在InterSpeech,ICASSP等语音会议或期刊中有论文发表者优先
熟练使用AI开发工具(如Jupyter、模型管理工具)及AI编程助手(如GitHub Copilot)
有语音AI项目成果者优先
对AI新技术保持好奇心,乐于主动学习并快速掌握新的AI知识和功能,积极拥抱新技术
符合京东价值观:客户为先、创新、拼搏、担当、感恩、诚信

工作职责

负责京东语音识别/合成方向的算法研究和开发工作,包括但不限于语音识别、合成,声纹、语种、情感等方向的算法研究和开发,语音信号处理,口语理解、意图识别、语音交互等算法研究和开发

负责将前沿语音算法落地到京东业务场景并取得应用效果
AI应用探索:积极跟踪语音领域AI前沿(如大模型驱动的语音技术),熟练运用AI开发工具加速模型研发与落地

AI 洞察

优缺点分析

优点

  • 京东作为大厂,平台资源丰富,语音数据量大,业务场景真实多样
  • 聚焦语音大模型前沿技术,技术栈领先,个人成长空间大
  • 应届生岗位,有完善的导师培养体系,可快速融入工业界项目
  • 语音算法竞争激烈,需要持续跟踪学术顶会(如ICASSP)并快速落地
  • 对数学和工程能力要求高,需要同时兼顾理论研究和代码实现

缺点 / 挑战

  • 薪资福利在大厂中具有竞争力,且公司稳定,职业风险低
  • 工作节奏较快,项目交付压力较大,可能需要加班
  • 这个职位适合对语音技术有浓厚兴趣、具备扎实算法和编程基础、愿意在大平台接受挑战的应届硕士或博士毕业生

角色解读

  • 技术方向:从语音算法工程师向高级算法专家发展,深耕语音识别/合成或大模型方向
  • 管理方向:逐步承担技术负责人角色,带领团队完成语音项目交付
  • 跨领域发展:结合京东业务(如客服、物流)转型为AI产品解决方案专家
  • 负责语音识别、合成、声纹识别等核心算法的研究与开发,设计并优化模型效果
  • 将前沿算法落地到京东业务场景(如客服、智能交互),解决实际业务问题
  • 跟踪大模型驱动的语音技术前沿,利用AI开发工具加速模型研发与迭代
  • 扎实的Python和C++编程能力,能够高效实现算法原型和系统集成
  • 深入的机器学习和深度学习知识,熟悉常用模型(如Transformer、RNN-T、VITS等)
  • 语音领域专业背景或项目经验,了解语音信号处理、特征提取、声学模型/语言模型等
  • 熟练使用AI开发工具(如Jupyter、模型管理工具)和AI编程助手(如Copilot)

申请策略

  • 提前了解京东的语音业务方向(如京东云客服、JDD大会),在面试中展示业务理解
  • 关注京东价值观(客户为先、创新等),在回答中体现团队合作和主动学习的态度
  • 突出语音相关项目和论文,尤其是与识别、合成、声纹相关的实践经历
  • 强调编程能力,列出使用Python/C++完成的具体项目或开源贡献
  • 展示对AI新技术的热情,比如参与过Kaggle、顶会竞赛或独立复现过前沿模型
  • 复习深度学习基础,特别是语音领域的常用模型(如Conformer、VITS、Whisper)
  • 熟悉至少一种深度学习框架(PyTorch/TensorFlow),并动手实现一个语音任务
  • 学习AI开发工具和编程助手,提升模型训练和部署效率

面试指南

  • 项目介绍类:使用STAR法则(情境-任务-行动-结果),突出个人贡献和难点突破
  • 技术原理类:先给出定义,然后对比不同方法的优劣,最后结合实际应用场景说明选择
  • 开放性问题:先阐述基础概念,再提出自己的见解,最后体现学习意愿(如“虽然我目前了解有限,但我愿意深入探索”)
  • 请介绍你做过的一个语音项目,包括模型设计、数据处理和最终效果
  • 解释一下CTC和Attention机制在语音识别中的区别和优缺点
  • 如果让你设计一个语音合成系统,你会选择哪些技术方案?为什么?
  • 如何评估语音模型在实际场景中的表现?请举例说明
  • 你对大模型在语音领域的应用有哪些了解?请谈谈你的看法

职位点评

73
综合评分

大厂校招语音算法岗,前沿技术栈、成长空间大,但需北京现场办公且节奏较快。

从起薪待遇、成长路径、工作节奏和岗位方向综合评估,方便比较职业起点。

更适合这类人
该职位最适合追求技术成长、渴望接触前沿语音大模型、能够接受一定工作压力的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活50
使命价值60

薪资福利

75中等

京东作为大厂,校招薪资福利有竞争力,但具体数值未披露,综合判断处于市场水准。

薪资信号未披露(AI估算:20K-30K/月)

成长发展

90较高

职位聚焦语音大模型前沿技术,技术栈新且有大量实践机会,成长空间非常大。

技术前沿前沿/新兴技术
技术栈语音识别、语音合成、大模型、深度学习、Python、C++
业务类型ambiguous

工作生活

50较低

北京现场办公,地点在科技园(京东总部),未提及弹性工作或远程,工作节奏可能较快。

工作模式仅现场办公
办公地点科技园/产业园
加班情况未提及(无法判断)

使命价值

60中等

电商行业稳定,语音AI有实际应用价值,但社会影响力中性,创新性较高但非颠覆性。

行业发展稳定成熟行业
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs