
腾讯
微信-高级算法工程师-音频理解/ASR/对话模型方向
微信-高级算法工程师-音频理解/ASR/对话模型方向
发布于 大约 2 个月前普通员工/个人贡献者
北京市
高级经验
全职员工
仅现场办公
学历未注明
软件工程
Megatron
Transducer
多模态
音频理解
ASR
Ctc
DeepSpeed
FSDP
LLM
AI 估算 · 30k–60k
腾讯高级算法工程师薪资在行业中处于领先水平,结合北京消费水平和AI岗位供需,月薪范围合理。
职位详情
关于这个职位
该职位隶属于腾讯微信团队,专注于音频理解、语音识别和语音对话大模型的研发与落地
你将参与从数据建设、模型训练到工程化部署的全链路工作,推动前沿语音技术在微信生态中的应用
适合有扎实深度学习背景和ASR/大模型经验的算法工程师
最低要求
具备扎实的机器学习、深度学习和语音信号处理基础,熟悉 ASR、音频理解或语音对话相关技术
有大模型训练经验,熟悉 LLM / 多模态大模型的预训练、SFT、RLHF/DPO/PPO、指令微调或模型评测流程
有 ASR 工程实践经验,熟悉 CTC、AED、Transducer、流式 ASR、动态 chunk、热词增强、ITN、VAD 等相关技术优先
熟悉 PyTorch、Megatron、DeepSpeed、FSDP、vLLM 等训练或推理框架中的一种或多种,具备大规模训练/推理优化经验优先
具备较强的工程实现能力和问题定位能力,能够独立完成从数据、训练、评测到部署的完整闭环
有良好的沟通协作能力,能与工程、产品、数据团队共同推动复杂语音能力落地
工作职责
负责音频理解、语音识别、语音对话大模型等方向的模型研发与落地,包括 ASR、S2TT/S2ST、音频问答、语音对话等核心能力建设
参与大规模音频/语音数据建设、清洗、标注、合成与评测体系搭建,持续提升模型在复杂场景下的理解、识别和交互能力
负责大模型训练与微调工作,包括预训练、SFT、偏好优化、多模态对齐、音频 encoder 与 LLM 融合等方向探索
推进 ASR 工程化落地,包括流式识别、实时上屏、上下文增强、热词/专有词优化、长语音识别、端侧/云侧推理等能力建设
跟进语音与多模态大模型前沿技术,结合业务场景完成技术选型、效果优化和线上落地
AI 洞察
优缺点分析
优点
- 腾讯微信平台,业务场景丰富,技术落地机会多
- 岗位涉及前沿的音频理解、语音对话大模型,技术方向热门
- 团队实力强,能接触大规模数据和分布式训练技术
- 薪资福利具有竞争力,职业发展空间大
- 技术难度高,需要同时掌握深度学习、语音信号处理和大模型训练
- 工程化落地要求高,需要处理实时性、准确率等复杂问题
- 竞争激烈,需要持续跟进前沿技术并快速迭代
缺点 / 挑战
- 适合热爱语音AI、有较强算法和工程能力、希望在大平台挑战前沿技术的算法工程师
角色解读
- 在语音AI领域深耕,成为音频理解或语音对话方向的专家
- 向多模态大模型或AI工程化方向拓展,成为技术负责人
- 在腾讯内部,有机会引领语音技术在微信生态中的创新应用
- 研发音频理解、语音识别和语音对话大模型,包括ASR、音频问答等核心能力
- 处理大规模音频数据,构建数据清洗、标注和评测体系
- 负责大模型训练与微调,探索多模态对齐和模型融合
- 推进ASR工程化落地,优化流式识别、热词增强等在线能力
- 扎实的机器学习、深度学习和语音信号处理基础
- 熟悉大模型训练流程(预训练、SFT、RLHF等)和相关框架
- 掌握ASR相关技术(CTC、AED、Transducer、流式ASR等)
- 熟练使用PyTorch、Megatron、DeepSpeed等训练推理框架
申请策略
- 了解微信语音业务场景(如语音输入、语音助手等),在面试中展示业务理解
- 准备一个端到端的ASR或语音对话项目案例,从数据到部署完整阐述
- 突出ASR或语音相关项目经验,尤其是大模型训练和微调经历
- 展示工程化能力,如流式ASR部署、推理优化等
- 强调使用过的框架(PyTorch、Megatron等)和数据处理经验
- 如果有顶会论文或竞赛奖项,务必列出
- 补充ASR工程实践经验,如流式识别、热词增强等
- 深入了解LLM和多模态对齐技术(如Qwen-Audio、SALMONN等)
面试指南
- 对于项目介绍,采用STAR法则(情境-任务-行动-结果),突出自己的贡献和难点突破
- 对于技术原理问题,先定义核心概念,再比较优劣,最后结合实践讲经验
- 对于优化问题,先分析瓶颈,再提出多种方案,并说明选择理由
- 请介绍你参与过的ASR或语音对话项目,包括技术选型和效果
- 大模型训练中遇到过哪些问题?如何解决显存不足、过拟合等?
- 流式ASR中的延迟和准确率如何权衡?你有何优化经验?
- 讲解一下CTC和Attention-based模型的区别及适用场景
- 如何评估一个语音识别系统的性能?有哪些指标?
职位点评
70
综合评分
腾讯微信高级算法岗,前沿语音大模型方向,技术成长性极强,但WLB可能一般。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长、不介意工作强度、希望在大平台做前沿AI的开发者。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活40
使命价值60
薪资福利
75中等
腾讯作为互联网大厂,薪资待遇优厚,但JD未提及具体福利,需面试确认。
薪资信号未披露(AI估算:30K-60K/月)
成长发展
90较高
岗位涉及前沿语音大模型技术,有大量学习和成长机会,但JD未明确提及晋升路径。
技术前沿前沿/新兴技术
技术栈ASR、LLM、多模态、RLHF、Transducer、Megatron
成长机会无限广阔的舞台、业界前沿不断探索
业务类型ambiguous
工作生活
40较低
北京办公,未提及弹性工作或远程,互联网大厂加班文化可能存在,WLB一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
60中等
语音技术改善人机交互,有一定社会价值,但JD未强调使命导向。
行业发展高速增长赛道
社会影响中性/一般
使命信号带来美好的、撼动人心的改变
创新程度积极采用新技术
腾讯 的其他在招职位
相似职位推荐
Watch Jobs