
普通员工/个人贡献者
综合评分 72
技术前沿、平台大、成长性强,但需适应7x24运维节奏。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
薪资怎么样
35K
比DevOps/SRE中位数低
发布情况
正常在招 · 18 天前发布
公司情况
这家公司招聘很活跃
约 2450 个在招 · 其中DevOps/SRE 16 个
市场机会
选择适中
杭州 · DevOps/SRE · 23 个在招
该职位是阿里巴巴乌鸫科技的大模型应急运维工程师,主要负责百炼大模型推理服务的全链路监控体系建设与应急响应
计算机相关本科及以上学历,1年以上互联网、云计算、AI Infra方向的运维保障经验,对故障排查、定位、快恢有一定经验积累
负责百炼大模型推理服务全链路的监控体系建设与应急响应,覆盖模型调用链路追踪、推理时延与吞吐监控、Token消耗与限流观测、GPU资源与卡型、推理引擎运行状态监控等核心场景,针对模型服务的限流、超时、OOM、推理性能退化等典型故障,建立快速定位与恢复机制,保障大模型服务的高可用与稳定输出
大模型推理服务运维经验
优点
缺点 / 挑战
暂无明显挑战项
职位隶属于大型上市企业,在杭州有一定竞争力,但未在JD中披露具体薪资范围,福利保障预期较完善。
该职位技术栈前沿,深度涉及大模型、GPU运维、AIOps和可观测性体系,能提供宝贵的大规模AI基础设施运维经验,成长性很强。
JD明确要求适应7x24值班(平均每月夜班3次),存在突发应急响应,对工作生活平衡有一定挑战。
工作直接支撑前沿大模型技术的落地与核心业务的稳定性,技术影响力和社会价值较高,属于新兴领域。
阿里巴巴 的其他在招职位