Agora logo
声网
AI-Agent工程师

AI-Agent工程师

发布于 大约 3 小时前

普通员工/个人贡献者

上海市
高级经验
全职员工
仅现场办公
不限
NLP工程
Ai Agent
Llm
可观测性
异步编程
系统设计
后端高可用
实时对话

AI 估算 · 30k–50k

上市大厂上海AI Agent岗位,技术栈前沿,需求旺盛,薪资竞争力强。

职位详情

关于这个职位

这是一个专注于构建生产级 AI Agent 的工程师岗位,你将负责设计并实现面向实时对话场景的 Agent 编排系统、策略系统和云端高可用后端服务

需要将 LLM Agent 从原型推进到稳定服务真实用户的阶段,并建立可观测性和自动化测试体系
适合有扎实 Python 后端功底、熟悉 LLM Agent 模式的工程师

最低要求

· 扎实的软件工程基本功,能写清晰,可维护,可测试的代码

· 熟悉 Python 后端开发,理解异步编程,任务队列,服务接口和状态管理
· 熟悉 LLM Agent 的基本模式,包括工具调用,任务规划,记忆,上下文管理和结果校验
· 理解 prompt,tool schema,function calling,MCP 或类似工具协议的工程实现
· 熟悉后端高可用设计,包括超时,重试,熔断,限流,降级,幂等,缓存和版本控制
· 熟悉 Linux,网络基础,日志,指标,链路追踪和服务部署
· 有强测试意识,能编写单元测试,集成测试和端到端测试
· 有良好的抽象能力,能把具体框架封装成可替换能力,而不是把业务绑死在某个工具上
· 习惯用数据验收效果,能定义指标,建立 baseline,并持续优化

工作职责

设计并实现 AI Agent 编排系统

你需要设计 Agent 的核心运行机制,让它能够基于对话上下文,用户状态,业务事件和工具结果,完成任务规划,策略生成,工具调用和结果整合
工作内容包括:
· 设计 Agent 的执行流程
· 支持多模型,多策略,多版本的实验,灰度和回滚
· 把 Agent 从“能跑起来”推进到“能稳定服务真实用户”
建设实时对话场景下的策略系统
实时对话的核心挑战是:系统既要更聪明,也不能变慢
你需要让 Agent 产出的策略能够不影响实时响应体验
工作内容包括:
· 与实时链路协同,确保新增能力不会明显增加用户感知延迟
建设云端高可用后端服务
这个岗位需要把 Agent 能力做成云端服务,而不是本地脚本或实验项目
你需要关注服务的可靠性,扩展性和可运维性
工作内容包括:
· 设计 Agent 服务的后端架构,接口协议,状态管理和生命周期管理
· 支持异步任务,队列,缓存,RPC,HTTP,WebSocket 或其他合适的服务形态
· 处理服务重启,节点故障,网络抖动,依赖超时,模型服务异常等生产问题
· 建设限流,熔断,降级,幂等,灰度发布和快速回滚能力
· 支持多租户,资源隔离,容量规划和成本治理
· 与平台,算法,产品,SRE 等团队协作,把 Agent 能力稳定接入真实业务
建设可观测性,测试和回放体系
Agent 系统不能只看“感觉变聪明了”
我们需要知道每一次策略为什么生效,每一次工具为什么被调用,每一次异常为什么被回退
工作内容包括:
· 建立 Agent 服务的日志,指标,链路追踪和告警体系
· 监控策略生成延迟,策略命中率,工具调用成功率,工具超时率,异常回退次数和实时链路影响
· 支持关键对话的 trace replay,能够复盘某次对话中系统做了什么判断,调用了哪些工具,为什么这样处理
· 建设单元测试,集成测试,端到端测试,回放测试和故障注入测试
· 用自动化测试和指标基线保障系统持续演进,而不是靠人工盯日志续命

优先资格

· 熟悉 Rust,能用 Rust 处理高性能,高可靠或安全边界相关模块

· 有 Conversational AI,语音助手,实时对话系统,RTC,流式处理或低延迟链路经验
· 熟悉 Kubernetes,Deployment,Service,Ingress,HPA,PDB,节点池和资源隔离
· 有 OpenTelemetry,Prometheus,Grafana,Loki,Jaeger 等可观测性体系经验
· 有主流 Agent 框架,Code Agent,Workflow Agent 或自动化任务系统经验
· 有 RAG,长期记忆,用户画像,向量数据库,知识检索或 memory manager 相关经验
· 有模型服务经验,熟悉多模型路由,模型网关,限流,成本控制和版本管理
· 有安全工程意识,理解 sandbox,权限最小化,tool policy,审计,prompt injection 和数据隔离
· 有复杂线上故障处理经验,能把故障复盘转化为代码,监控,测试和自动化机制

AI 洞察

优缺点分析

优点

  • 技术前沿:直接参与 AI Agent 核心能力建设,接触最新 LLM 技术和工程实践
  • 平台优势:声网在实时音视频领域有深厚积累,可结合 RTC 场景做出独特产品
  • 成长空间:从零到一构建生产级系统,全面锻炼架构设计、运维和协作能力
  • 技术复杂度高:需同时兼顾对话智能和实时低延迟,平衡策略效果与系统性能
  • 工程要求严苛:需处理各种生产环境异常,建设完整的可观测性和自动化体系
  • 跨团队协作多:需要与算法、产品、SRE 等多个团队紧密配合
  • 适合具备扎实 Python 后端基础、对 LLM Agent 有热情、追求高可用系统设计的资深工程师

缺点 / 挑战

暂无明显挑战项

角色解读

  • 技术纵深:从 Agent 工程走向 AI 系统架构师,掌握大规模对话系统和分布式架构
  • 横向拓展:可转向算法方向(LLM 微调、RAG)、平台工程或 AI infra 领域
  • 管理路线:积累项目经验后可晋升为技术负责人或团队主管
  • 设计和实现 AI Agent 编排系统,让 Agent 能够基于上下文完成规划、工具调用和结果整合
  • 建设实时对话场景下的策略系统,确保新增能力不增加用户感知延迟
  • 开发云端高可用后端服务,处理限流、熔断、降级、灰度发布等生产问题
  • 建立可观测性、测试和回放体系,通过指标和自动化测试保障系统稳定演进
  • 扎实的 Python 后端开发能力,熟悉异步编程、任务队列和高可用设计
  • 深入理解 LLM Agent 模式(工具调用、任务规划、记忆、上下文管理)
  • 熟悉后端高可用技术:超时、重试、熔断、限流、降级、缓存、版本控制
  • 强测试意识,能编写单元测试、集成测试和端到端测试,习惯用数据评估效果

申请策略

  • 在面试中结合真实案例说明如何将 Agent 从原型推进到生产环境,强调数据驱动的优化方法
  • 了解声网的实时音视频产品(RTC),思考 AI Agent 如何与之协同
  • 突出 Python 后端高可用项目经验,特别是异步编程、消息队列、服务治理等实践
  • 强调 LLM Agent 相关项目(如工具调用、任务规划、记忆机制等),附上代码或链接
  • 展示可观测性体系建设经验(日志、指标、链路追踪)和自动化测试成果
  • 学习主流 Agent 框架(LangChain、AutoGPT、CrewAI 等)以及 MCP 协议
  • 熟悉 Kubernetes 基础操作和服务部署,了解 HPA、PDB 等概念
  • 补充 Rust 基础(加分项),可练习编写简单的高性能模块

面试指南

  • STAR 方法:描述具体场景、任务、行动和结果,突出工程实践和数据量化
  • 分层设计思想:将系统分为编排层、策略层、服务层和观测层,分别阐述各层职责和交互
  • 权衡与取舍:在智能与延迟、灵活与稳定之间如何做决策,体现工程思维
  • 请描述设计一个生产级 AI Agent 编排系统的技术方案,包括关键组件和容错机制
  • 如何处理 LLM 调用超时或返回错误?如何保证实时对话的体验不受影响?
  • 如何设计可观测性体系来监控 Agent 策略生成和工具调用的效果?
  • 请举个例子说明你如何通过数据(指标)驱动系统优化?
  • 如果 Agent 在灰度发布后出现异常,如何快速回滚并排查问题?

职位点评

71
综合评分

上市大厂上海AI Agent岗,前沿技术栈,高成长,办公模式传统,WLB不确定。

从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。

更适合这类人
最适重视技能成长和前沿技术的求职者,对于追求高薪资和职业发展的人很有吸引力。
表现最好
成长发展
相对薄弱
工作生活
薪资福利75
成长发展92
工作生活40
使命价值65

薪资福利

75中等

上市大厂、上海、高端技术岗位,薪资有竞争力,但未明确提及福利细节。

薪资信号未披露(AI估算:30K-50K/月)

成长发展

92较高

职位涉及最前沿的 AI Agent 技术栈,深度参与系统设计,成长空间极大。

技术前沿前沿/新兴技术
技术栈Python、AI Agent、LLM、Rust、Kubernetes、可观测性、MCP
成长机会实验、灰度、回滚、多版本、可替换能力
业务类型profit_center

工作生活

40较低

仅现场办公,上海地段未明确,且未提及WLB,可能涉及高强度工程挑战。

工作模式仅现场办公
办公地点未明确
加班情况未提及(无法判断)

使命价值

65中等

AI Agent是高速增长赛道,但职位偏向技术实现,社会使命感不明显。

行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
Watch Jobs