
智元机器人
语音大模型后端工程师
语音大模型后端工程师
发布于 大约 13 小时前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
本科
软件工程
Asr
Go
Pytorch
Tensorrt
Tts
Vllm
Websocket
AI 估算 · 35k–55k
语音大模型后端属于高稀缺技术方向,结合上海资深工程师薪资水平和B轮公司竞争力,月薪在3.5万-5.5万之间,并且通常有期权激励。
职位详情
关于这个职位
作为语音大模型后端工程师,你将负责构建高并发、低延迟的语音AI服务,包括ASR、TTS和端到端语音交互系统
你需要设计流式处理架构,优化模型推理性能,并搭建支持多业务线的语音中台
这是一个技术深度极高的岗位,适合对语音AI和大模型推理有热情的后端专家
最低要求
本科及以上学历,计算机、通信、电子工程等相关专业,5年以上后端开发经验
精通Python/Go/C++至少一门语言,具备扎实的多线程/多进程编程能力
深入理解流式处理架构,熟悉WebSocket、HTTP/2、GRPC等实时通信协议
熟悉语音AI领域,了解ASR、TTS、Omni模型原理
掌握大模型推理优化技术,有vLLM、TensorRT-LLM、Triton Inference Server等部署经验
熟悉Kubernetes、Docker等容器化部署,具备云原生架构设计能力
深度学习框架:PyTorch、ONNX Runtime、TensorRT
流式处理:WebSocket、Server-Sent Events、HTTP/2 Server Push、GRPC Streaming
音频处理:FFmpeg、WebRTC、Opus编码、音频分片与缓冲策略
服务架构:FastAPI/Go-gin、gRPC、Redis、Kafka/RabbitMQ、Nginx
运维监控:Prometheus、Grafana、ELK、链路追踪(Jaeger/Zipkin)
工作职责
ASR服务开发:设计并实现高吞吐量的语音识别后端服务,支持实时流式转写、时间戳对齐等功能,优化首字延迟与尾字延迟
TTS服务开发:构建低延迟语音合成服务,实现流式音色克隆、情感控制、多语言混合合成,优化音频流分片与传输策略
Omni端到端服务:开发端到端语音交互系统,支持语音到语音的直接推理,实现全双工对话能力
流式处理架构:设计WebSocket/HTTP2流式传输协议,实现Chunk级数据流转,优化端到端延迟至200ms以内
高并发系统:构建支持高并发的服务集群,实现负载均衡、弹性扩缩容、故障自动恢复
模型部署优化:负责大模型的推理加速(TensorRT/vLLM/TensorRT-LLM),实现GPU资源调度与多卡推理优化
业务中台建设:搭建语音AI业务中台,抽象通用能力,支撑多业务线快速接入
优先资格
有大规模语音AI服务落地经验
熟悉端侧推理优化,有移动端/边缘设备语音模型部署经验
开源语音项目贡献者(如Whisper、Kaldi、ESPnet等)
有全双工语音对话系统开发经验
熟悉大模型微调与量化技术(LoRA、QLoRA、AWQ、GGUF等)
AI 洞察
优缺点分析
优点
- 语音大模型是AI前沿方向,技术栈新且难度高,能显著提升个人竞争力
- 公司B轮阶段,技术话语权强,有机会从零到一搭建高并发服务
- 薪资水平高,通常附带期权,未来回报潜力大
- 团队氛围技术驱动,可接触大量前沿工具链(vLLM、TensorRT-LLM)
- 需要同时掌握后端架构、大模型推理、音频处理等多领域知识,学习曲线陡峭
- B轮公司节奏快,可能需要应对快速迭代的业务需求
- 适合有5年以上后端经验、对语音AI和大模型推理有浓厚兴趣、追求技术深度且适应快节奏的技术专家
缺点 / 挑战
- 对实时性要求极其严苛(延迟<200ms),技术挑战大,压力较高
角色解读
- 技术深耕:成为语音AI后端架构专家,主导端到端语音交互系统的架构演进
- 管理路线:晋升为技术主管或技术经理,带领团队攻克高并发和低延迟挑战
- 横向拓展:向语音算法或机器人系统方向延伸,成为复合型AI专家
- 设计和实现高吞吐量的ASR后端服务,支持实时流式转写和低延迟优化
- 构建低延迟TTS服务,实现音色克隆、情感控制等高级功能
- 开发端到端语音交互系统,实现全双工对话能力,优化流式传输和推理延迟
- 搭建高并发服务集群,负责负载均衡、弹性伸缩和故障恢复,并优化大模型推理性能
- 精通Python/Go/C++,具备扎实的多线程编程和系统设计能力
- 深入理解流式处理架构和实时通信协议(WebSocket、gRPC)
- 熟悉语音AI领域,掌握ASR、TTS、Omni模型原理及推理优化技术
- 具备Kubernetes、Docker等云原生部署经验,以及GPU资源调度能力
申请策略
- 提前了解智元机器人的业务方向(如机器人语音交互),面试时展示与业务的结合思考
- 准备一个完整的系统设计案例,重点说明如何实现200ms端到端延迟
- 突出流式处理相关项目经验,如基于WebSocket的实时音频服务
- 强调大模型推理优化实战,具体说明使用TensorRT/vLLM的优化效果
- 展示高并发系统设计案例,包括负载均衡、弹性伸缩等技术细节
- 如有语音AI相关项目(ASR/TTS/Omni),详细描述业务指标和性能优化
- 补充vLLM、TensorRT-LLM等推理框架的深入实践
- 学习端侧推理优化技术(如ONNX Runtime、NCNN)以增加加分项竞争力
面试指南
- 使用STAR法则:描述背景、任务、行动和结果,量化优化效果(如延迟降低X%)
- 从架构分层(接入层、服务层、模型层)和关键指标(延迟、吞吐量、资源利用率)展开
- 对比不同方案的优缺点,结合业务场景给出选择理由,避免空谈理论
- 如何设计一个支持高并发、低延迟的流式ASR服务?请画出架构图并说明关键技术点
- 你如何优化大模型推理延迟?具体用过哪些工具,效果如何?
- 请解释WebSocket和HTTP/2 Server Push在流式传输中的差异和适用场景
- 假设我们需要在边缘设备部署TTS模型,你会如何优化?
- 你如何监控和诊断一个分布式语音服务的性能瓶颈?
职位点评
73
综合评分
高薪前沿技术岗,语音大模型后端,成长空间巨大但工作强度可能较高。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合追求技术成长和薪资回报、能接受高强度工作的资深后端工程师。
表现最好
成长发展
相对薄弱
工作生活
薪资福利80
成长发展90
工作生活40
使命价值70
薪资福利
80较高
薪资处于市场高位,B轮公司通常有期权,但未明确福利,综合满足度较高。
薪资信号未披露(AI估算:35K-55K/月)
成长发展
90较高
技术栈前沿(语音大模型、推理优化),成长空间大,但JD未明确提及培训或晋升通道。
技术前沿前沿/新兴技术
技术栈ASR、TTS、Omni、vLLM、TensorRT-LLM、TensorRT、PyTorch、Kubernetes、WebSocket、gRPC
业务类型profit_center
工作生活
40较低
仅现场办公,未提及弹性工作或福利,且语音AI领域通常对实时性要求高,可能涉及高强度加班。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
70中等
机器人语音交互属于AI前沿,有一定社会价值,但JD未明确使命感,行业前景好。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
智元机器人 的其他在招职位
相似职位推荐
Watch Jobs