Hikvision logo
海康威视
研究院-智能音频算法工程师-杭州

研究院-智能音频算法工程师-杭州

发布于 大约 7 小时前

普通员工/个人贡献者

杭州市
中级经验
全职员工
仅现场办公
硕士
研究与开发 (研发)
Asr
Audio Llm
Pytorch
Tensorflow
Tts
Speaker Recognition
Wake-Up

AI 估算 · 25k–40k

杭州头部企业研究院,音频算法岗位技能稀缺,薪资具备竞争力。

职位详情

关于这个职位

该职位是海康威视研究院的智能音频算法工程师,专注于音频大模型、语音识别、声纹识别、语音合成等前沿音频技术的研究与实现

适合对音频处理有浓厚兴趣,具备扎实数学与编程基础,希望在大型企业研究院深耕技术的求职者

最低要求

硕士及以上学历,计算机、模式识别、电子工程、应用数学类等相关专业

具有较好的数学功底,对模式识别、机器学习有较深入的理解与认识
在下述任一领域有研究经历:音频大模型\语音识别\声纹识别\音频生成\语音事件检测分类\语音唤醒
熟练掌握C\C++\Python,具备扎实的编程基础

工作职责

负责音频理解与生成大模型、语音识别、声纹识别、语音合成、语音唤醒、异常检测相关算法的研究与实现

优先资格

熟练使用Kaldi、Tensorflow、PyTorch及其它开源框架者优先

有实际项目开发或参加竞赛经验者优先
有音频大模型训练经验者优先
在InterSpeech,Icassp等国际顶级会议或期刊上发表过文章者优先

AI 洞察

优缺点分析

优点

  • 海康威视作为安防巨头,研究院资源充足,项目落地场景丰富
  • 音频算法为AI前沿领域,技术成长空间大,接触最新大模型技术
  • 团队氛围科研导向,有机会发表顶级会议论文
  • 薪资在杭州具备竞争力,大厂福利完善
  • 算法研究岗位对数学和编程要求极高,需要持续学习前沿论文
  • 音频领域竞争激烈,需保持技术领先,加班可能不可避免
  • 适合对音频算法有强烈兴趣、热爱钻研技术、希望在大平台做前沿研究的硕士及以上学历求职者

缺点 / 挑战

  • 研究院可能面临技术落地与业务需求之间的平衡压力

角色解读

  • 从算法工程师成长为音频技术专家,主导核心算法方向
  • 可转向技术管理路线,带领团队攻克复杂音频问题
  • 立足海康平台,横向拓展至计算机视觉、多模态等领域
  • 研究并实现音频大模型、语音识别、声纹识别、语音合成等前沿算法
  • 优化算法性能,推动技术落地到海康威视的各类安防与智能产品
  • 跟进学术界最新进展,将论文成果转化为实际工程方案
  • 扎实的数学基础,深入理解机器学习与模式识别理论
  • 精通C/C++/Python编程,具备高效的算法实现能力
  • 在音频大模型、语音识别、声纹识别等至少一个领域有研究或项目经验
  • 熟练使用Kaldi、TensorFlow、PyTorch等主流框架

申请策略

  • 提前了解海康威视的音频产品线(如智能摄像机、对讲设备),在面试中体现业务理解
  • 关注研究院的技术博客或开源项目,展示对团队的了解和热情
  • 突出音频相关项目经验,如语音识别系统、音频大模型训练等
  • 展示编程能力,尤其是C++/Python和深度学习框架的熟练度
  • 如有论文或竞赛获奖,务必重点提及
  • 强调数学基础,如概率论、线性代数、优化理论等课程成绩或应用
  • 若缺乏音频经验,可快速学习Kaldi或WeNet,并复现一篇语音领域论文
  • 熟悉PyTorch深度学习框架,掌握模型训练与调优技巧

面试指南

  • STAR法则:情境-任务-行动-结果,结构化描述项目
  • 技术问题:先讲原理,再结合实际经验,体现思考深度
  • 开放性问题:展现知识面,同时表达个人见解
  • 请介绍一个你参与过的音频算法项目,从问题定义到最终结果
  • 如何训练一个高精度的语音识别模型?数据、模型架构、训练技巧有哪些?
  • 解释Transformer在语音领域的应用,如Conformer模型
  • C++中内存管理有哪些注意事项?如何优化算法效率?
  • 你如何看待音频大模型的发展趋势?未来哪些方向可能爆发?

职位点评

68
综合评分

海康研究院音频算法岗,技术前沿,薪资有竞争力,现场办公为主。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
适合追求技术深度和前沿领域、不介意现场办公的求职者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利70
成长发展85
工作生活50
使命价值55

薪资福利

70中等

薪资在杭州具备竞争力,大厂福利稳定,但JD未明确具体薪资与福利,薪酬信号偏保守。

薪资信号未披露(AI估算:25K-40K/月)

成长发展

85较高

岗位聚焦音频大模型等前沿技术,研究院科研氛围浓厚,成长空间大,但JD未明确晋升路径。

技术前沿前沿/新兴技术
技术栈Audio LLM、ASR、Speaker Recognition、TTS、Wake-up、Anomaly Detection、Kaldi、TensorFlow、PyTorch
业务类型ambiguous

工作生活

50较低

仅现场办公,工作地点为杭州,未提及弹性工时或远程选项,WLB信息不足。

工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)

使命价值

55较低

安防领域社会影响力中性,音频技术虽重要但直接社会价值不突出,行业增长较为稳定。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs