
滴滴出行
资深语音算法工程师
资深语音算法工程师
发布于 大约 9 小时前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
学历未注明
软件工程
Icassp
Interspeech
Pytorch
声纹识别
多模态大模型
语音合成
语音大模型
语音识别
音频事件检测
AI 估算 · 35k–65k
北京大厂资深算法岗,语音技术稀缺,薪资竞争力强。
职位详情
关于这个职位
该职位负责将语音理解与生成算法应用于滴滴出行场景,涉及语音识别、声纹识别、语音合成等技术的优化与落地
同时跟进前沿语音大模型和多模态大模型,探索创新应用
要求具备扎实的语音信号处理和Pytorch编程能力,有3-5年相关算法经验
最低要求
电子、计算机或相关声学、信号处理专业毕业,具备一定语音信号处理基础
熟悉Pytorch框架,良好的编程能力,熟练使用python编程语言,具备Linux平台开发经验
-5年语音识别、音频事件检测、声纹识别、语音合成等算法经验
工作职责
负责语音理解和语音生成算法在滴滴场景的落地使用
跟进最新技术,结合业务场景,提升语音识别、音频事件检测、声纹识别、语音合成等算法效果
探索语音大模型或多模态大模型在语音理解及语音生成场景的应用范式
优先资格
在ICASSP、Interspeech、ASRU等语音顶会或国际竞赛有论文发表或优异成绩优先
ACM竞赛取得优异成绩或有优秀C++编程能力优先
有大型语音识别、语音合成项目经验者优先
AI 洞察
优缺点分析
优点
- 滴滴作为出行巨头,拥有海量真实语音场景,数据资源丰富
- 团队专注AIoT产品,技术落地与业务价值直接挂钩,成就感强
- 语音大模型方向前沿,个人技术成长空间大
- 语音领域竞争激烈,需要持续跟进最新研究
- 适合有3-5年语音算法经验、热爱技术落地、愿意探索前沿技术的工程师
缺点 / 挑战
- 算法落地需兼顾性能与实时性,工程挑战较高
角色解读
- 在语音领域深耕,成为算法专家或技术负责人
- 向多模态或大模型方向拓展,参与更前沿的AI研究
- 负责语音识别、音频事件检测、声纹识别等算法的落地优化,提升AIoT产品体验
- 探索语音大模型和多模态大模型在语音理解与生成中的前沿应用
- 与业务团队协作,将算法部署到实际场景并持续迭代
- 扎实的语音信号处理基础,熟悉语音识别、合成、声纹识别等核心算法
- 熟练使用Pytorch和Python,具备Linux开发环境下的工程能力
- 具备顶会论文或竞赛经验者优先,体现算法创新能力
申请策略
- 面试时准备一个完整的语音项目复盘,从问题定义到效果提升
- 突出语音相关项目经验,尤其是从算法到落地的完整案例
- 强调Pytorch编程能力和Linux开发经验,展示工程化水平
- 如有顶会论文或竞赛成绩,单独列出
- 补充C++编程能力,增加面试竞争力
- 提前了解滴滴AIoT业务场景,思考算法如何适配
面试指南
- STAR法则:情境、任务、行动、结果,结构化描述项目
- 对比不同方案的优缺点,体现技术深度和选择依据
- 请详细介绍一下你做过的一个语音识别项目,包括数据、模型、效果和落地
- 如何平衡语音识别的准确率和实时性?
- 你对语音大模型有哪些了解?如何将其应用到具体业务?
- Pytorch中如何进行模型部署和优化?
- 请解释一下声纹识别的基本原理和主流方法
- 复习语音识别、合成、声纹的经典论文和最新进展
职位点评
69
综合评分
大厂核心技术岗,薪资竞争力强,技术前沿,但工作压力大且灵活性低。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术前沿和职业成长的算法工程师,能接受高强度工作。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展88
工作生活40
使命价值60
薪资福利
75中等
滴滴作为上市大厂,薪资福利有竞争力,但未在JD中明确薪资和具体福利,薪资信号为未披露。
薪资信号未披露(AI估算:35K-65K/月)
成长发展
88较高
工作内容涉及前沿语音大模型和多模态技术,成长空间大,但JD未明确提及晋升或培训机制。
技术前沿前沿/新兴技术
技术栈语音识别、音频事件检测、声纹识别、语音合成、语音大模型、多模态大模型、Pytorch、Python
业务类型profit_center
工作生活
40较低
职位要求仅现场办公,北京办公室通常位于市区,通勤压力较大,且未提及弹性工作或WLB。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
60中等
滴滴AIoT产品服务于出行场景,技术对社会有实际价值,但JD未提及使命或社会影响力。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
滴滴出行 的其他在招职位
相似职位推荐
Watch Jobs