
普通员工/个人贡献者
综合评分 74
前沿音频AI技术岗,技术成长性极强,但办公与WLB信息未明确。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
薪资怎么样
4.5万
与机器学习工程中位数基本持平
发布情况
新岗位 · 今天发布
公司情况
这家公司招聘很活跃
约 2850 个在招 · 其中机器学习工程 约 170 个
市场机会
选择面较广
北京 · 机器学习工程 · 约 470 个在招
该职位是阿里巴巴Token Foundary事业部未来生活实验室的音频算法专家/高级专家,核心工作是研发前沿的音频大模型,实现语音识别、合成与理解的端到端融合,并负责优化多语种、情感化语音生成及多模态音乐生成等任务
熟悉主流音频架构(如 Whisper, VITS, AudioLM, Vall-E,CosyVoice)
研发前沿的音频大模型 (Audio-LLM),实现语音识别 (ASR)、语音合成 (TTS) 与音频理解的端到端融合
有全双工、超低延迟流式语音交互系统(Real-time Interactive Voice)的落地经验者优先
优点
缺点 / 挑战
薪资水平属于市场中上区间,但JD未提供明确数字,具体竞争力取决于谈判。
岗位聚焦于音频大模型等前沿技术领域,能接触顶尖的技术挑战和丰富的资源,对技术深度成长极为有利。
办公地点为北京或杭州,但JD未说明具体工作模式与WLB情况,存在不确定性。
处于人工智能的高速增长赛道,从事前沿技术研发,具有较高的技术创新价值。
阿里巴巴 的其他在招职位