
声网
AI基础设施工程师
AI基础设施工程师
发布于 1 天前普通员工/个人贡献者
上海市
高级经验
全职员工
仅现场办公
不限
平台工程
CI/CD
Gitops
Gpu
Tdd
云原生
分布式系统
AI 估算 · 35k–55k
高级AI基础设施岗位,技能稀缺,市场竞争力强,参考一线互联网薪资水平。
职位详情
关于这个职位
该职位负责建设声网下一代统一基础设施平台,支撑AI训练、推理以及实时音视频(RTC)等核心业务
你将参与平台化交付、稳定性建设、资源性能治理(含GPU调度)等工作,需要具备扎实的软件工程基础、TDD意识以及云原生技术经验
适合对Kubernetes、分布式系统、AI基础设施方向有浓厚兴趣的后端/基础设施工程师
最低要求
扎实的软件工程基本功:清晰的抽象能力、可维护代码、良好编码规范与文档习惯
TDD 或强测试意识* :能编写单元测试、集成测试与端到端测试,习惯用测试保障迭代质量
流程化与自动化思维* :能把重复操作沉淀为脚本、工具或流水线,提升交付一致性
熟悉 Linux 基础与网络基础(超时/重试、限流/熔断、负载均衡、可用性与容量等概念)
良好的问题定位与故障处理能力:能用日志/指标/追踪快速缩小问题范围并给出工程化修复方案
工作职责
平台化交付
把 AI(训练/推理/离线)与实时业务(Conversational AI、RTC)相关能力沉淀为平台组件与标准化模板,让团队更快、更稳定地交付核心业务
稳定性与可运维性建设
完善监控告警、日志与追踪、发布回滚、故障演练与应急机制,让系统在高负载与异常场景下仍可控
资源与性能治理(含 GPU/CPU/网络/存储)
面向训练、离线与在线推理、以及对话与实时通信等不同形态,持续优化资源分配、调度策略与成本效率,并通过数据与自动化手段验证效果
工程化与自动化体系
用测试、流水线与工具链把重复劳动变成自动化流程,降低接入与迭代成本,提升交付质量与一致性
跨团队协作与方案落地
与算法、产品、业务、SRE 等团队合作,把需求抽象成可复用的平台能力,并推动在真实场景中稳定落地
优先资格
云原生:Kubernetes(Deployment/Service/Ingress/Gateway、HPA、PDB、affinity、taints/tolerations、节点池与隔离)
分布式与调度:作业编排、资源隔离、队列与优先级、配额治理、多集群或弹性伸缩经验
GPU 与性能优化:显存/吞吐/尾延迟分析、micro-batching、异构算力治理、MIG/MPS 等经验
训练相关经验:分布式训练(任意框架均可)、checkpoint/容错、训练任务管理与数据通道/存储优化
推理相关经验:模型服务化、灰度发布、容量规划、性能基线与回归
Conversational AI 相关* :语音/对话链路工程化经验(如低延迟、流式处理、服务编排、链路可观测性等)
RTC 相关* :实时通信系统经验(如时延抖动治理、容量规划、QoS 指标、在线故障处理等)
可观测性与 SRE:Prometheus/Grafana、日志体系、告警规则设计、Runbook、故障演练
交付体系:CI/CD、GitOps(ArgoCD/Flux)、蓝绿/灰度/回滚策略
AI 洞察
优缺点分析
优点
- 涉及AI基础设施前沿领域,技术含量高,能积累GPU调度、云原生等稀缺技能
- 公司已上市,平台稳定,薪酬福利有竞争力
- 接触多种工作负载(训练/推理/实时通信),技术视野广阔
- 对工程能力要求极高,需要深入理解分布式系统、云原生和性能优化
- 技术更新迭代快,需要持续学习新工具和框架
缺点 / 挑战
- 基础设施岗位可能需要on-call,保障系统稳定性压力较大
- 适合具备扎实后端/基础设施背景、热爱技术挑战、追求长期职业发展和深度成长的工程师
角色解读
- 向资深平台架构师方向发展,负责更大规模基础设施的设计与演进
- 可专精AI基础设施领域,如GPU调度、分布式训练平台负责人
- 有机会向技术管理岗位发展,带领基础设施团队
- 建设统一基础设施平台,将AI训练、推理和实时音视频业务沉淀为可复用的平台组件与标准化模板
- 完善监控、告警、日志、追踪等可观测性体系,保障系统在高负载与异常场景下的稳定性
- 优化GPU/CPU/网络/存储等资源调度与成本效率,提升系统性能和资源利用率
- 通过TDD、自动化流水线和工具链,将重复劳动自动化,提升工程交付效率与一致性
- 扎实的软件工程基本功,具备清晰的抽象能力和可维护代码的编写习惯
- 掌握TDD,能够编写单元测试、集成测试与端到端测试来保障质量
- 熟悉Linux和网络基础,理解超时、重试、限流、熔断等概念
- 了解云原生技术栈(Kubernetes、Docker)和CI/CD流水线
申请策略
- 了解声网的业务方向(RTC、Conversational AI),在面试中体现对实时通信与AI结合的理解
- 准备1-2个生产环境的技术案例,详细描述问题背景、解决过程和量化效果
- 突出云原生项目经验,如Kubernetes集群运维、CI/CD流水线搭建
- 强调TDD实践和自动化测试经验,体现代码质量意识
- 展示GPU/分布式训练或推理服务的性能优化案例,量化结果
- 提及可观测性体系建设(监控、日志、链路追踪)的具体实践
- 系统学习Kubernetes高级特性(HPA、调度策略、多集群管理)
- 掌握GPU性能分析工具(如nvidia-smi、Nsight)和优化方法(micro-batching、MIG)
面试指南
- 先明确问题边界和约束,再给出方案,强调关键权衡和取舍
- 对于故障处理类问题,采用STAR法则(情境、任务、行动、结果)结构化回答
- 展示技术细节和工程化思考,避免只谈理论
- 如何设计一个支撑AI训练和推理的统一平台架构?
- 描述一次你通过监控和日志定位线上故障的经历,并给出修复方案
- 你如何用TDD保障代码质量?请结合具体项目举例
- Kubernetes中如何实现GPU资源调度和隔离?谈谈你的实践经验
- 如何优化分布式训练的效率?你会使用哪些工具和策略?
职位点评
75
综合评分
前沿AI基础设施平台,技术成长性强,薪资优厚但办公灵活性一般
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
该职位最适合追求技术深度和成长、以长期职业发展为首要目标的求职者,能接受现场办公和可能的运维压力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展90
工作生活60
使命价值65
薪资福利
75中等
该职位为高级技术岗,薪资预计处于市场较高水平,公司已上市,整体稳定性好,能在物质回报上较好满足求职者。
薪资信号未披露(AI估算:35K-55K/月)
成长发展
90较高
职位技术深度和广度兼具,涉及云原生、GPU、分布式调度等前沿方向,对个人能力提升和职业发展帮助巨大。
技术前沿前沿/新兴技术
技术栈Kubernetes、GPU、TDD、CI/CD、GitOps、分布式调度、Prometheus、Grafana
业务类型cost_center
工作生活
60中等
该职位为上海现场办公,未提及弹性工作或远程选项,基础设施工作可能有值班值守需求,工作与生活平衡相对一般。
工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)
使命价值
65中等
该职位通过构建基础设施推动AI和实时通信应用落地,具有一定技术价值,但直接的社会意义感相对中性。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
声网 的其他在招职位
相似职位推荐
Watch Jobs