
小红书
客户端可观测性架构师
客户端可观测性架构师
发布于 大约 14 小时前普通员工/个人贡献者
北京市 / 上海市
高级经验
全职员工
仅现场办公
本科
架构师
Apm
Logs
Opentelemetry
可观测性
客户端
性能优化
智能诊断
架构设计
AI 估算 · 40k–65k
资深架构师岗位,技术栈前沿,小红书的薪资竞争力强,市场行情在此范围。
职位详情
关于这个职位
负责小红书客户端可观测性体系的顶层设计与落地,整合性能、稳定性、埋点、日志、网络五大维度
设计基于 Trace/Metrics/Logs 三大支柱的观测平台,建设智能诊断能力,推动 OpenTelemetry 等开源标准的客户端落地
这是一个高级技术岗位,适合有深厚客户端架构经验和可观测性平台设计背景的专家
最低要求
本科及以上学历,计算机相关专业,8 年以上客户端开发经验,5 年以上基础架构/平台方向经验
有完整的可观测性平台设计经验,熟悉 Trace/Metrics/Logs 三大支柱的技术方案和业界实践(Bugly、火山引擎、Grafana等)
深入理解客户端性能优化、埋点体系、日志框架中至少 2 个方向,具备系统化的架构设计能力
熟悉端侧数据采集的核心挑战(电量、流量、存储、隐私合规)及其工程化解决方案
工作职责
负责客户端可观测性体系的顶层设计与落地,统一整合性能、稳定性、埋点、日志、网络五大观测维度
设计客户端 Observability 平台架构:
统一数据采集层(Trace / Metrics / Logs 三大支柱)
数据通道层(端侧聚合、压缩、加密、分级上报)
平台分析层(实时查询、聚合分析、异常检测、根因定位)
应用层(性能大盘、崩溃分析、埋点校验、日志回捞、网络诊断)
负责 Trace 体系设计:
定义客户端 Trace 模型(Span、Context Propagation)
实现跨端、跨网络层的 Trace 串联(端侧 Span → 网关 → 服务端)
支持手动埋点和自动插桩两种 Trace 生成模式
建设智能诊断能力:
崩溃堆栈自动聚类与根因分析
性能劣化自动归因(基于 Trace 的热点定位)
用户投诉一键诊断(通过 UserID 串联日志、Trace、埋点、网络请求)
推动 OpenTelemetry 等开源标准在客户端的落地,建立统一的数据模型和 SDK 规范
优先资格
有以下经验者优先:
有自研 APM 平台或可观测性平台的经验
有相关客户端 SDK 开发或贡献经验
有全链路 Trace(端 → 网关 → 服务)的落地经验
在性能/可观测性方向有技术分享或论文发表
AI 洞察
优缺点分析
优点
- 小红书业务增长快,平台规模和复杂度提供广阔的技术实践场景
- 薪资待遇优厚,公司福利好,股票期权有吸引力
- 工作强度较大,需要应对复杂的端侧和平台技术难题
- 对综合能力要求高,既要懂客户端又要懂后端
- 行业竞争激烈,需要持续跟进开源社区和行业最佳实践
缺点 / 挑战
- 涉及核心基础设施建设,技术挑战大,能快速积累可观测性领域的稀缺经验
- 适合有丰富客户端架构经验且对可观测性有热情的技术专家,追求高难度技术挑战和长期职业发展
角色解读
- 技术专家路线:深耕可观测性领域,成为公司级乃至行业级权威
- 架构师路线:横向扩展到更多基础设施领域,如网络、存储
- 管理路线:带领可观测性团队,向技术总监发展
- 设计并落地客户端的可观测性平台,整合 Trace、Metrics、Logs 三大数据支柱
- 构建端到端的 Trace 体系,实现从客户端到服务端的全链路追踪
- 开发智能诊断能力,如崩溃自动聚类、性能劣化归因等
- 推动 OpenTelemetry 等开源标准在客户端的标准化实施
- 深厚的客户端开发经验(iOS/Android),8年以上
- 精通可观测性三大支柱(Trace/Metrics/Logs)及业界实践
- 熟练掌握端侧数据采集的挑战与解决方案(电量、流量、隐私等)
- 具备大型平台架构设计能力,熟悉 Kafka、Grafana 等后端组件
申请策略
- 在面试中准备一个具体的可观测性平台设计方案,体现架构思维
- 关注小红书的业务特点和客户端场景(社区、电商等),思考可观测性如何赋能业务
- 突出过去主导的可观测性或APM平台项目,说明架构设计和落地效果
- 强调 Trace 体系设计经验,特别是端到端全链路追踪
- 展示客户端性能优化、埋点系统、日志框架等方面的深度实践
- 如果有开源贡献(如 OpenTelemetry)或技术文章,务必列出
- 熟悉 OpenTelemetry 标准和 SDK 实现,阅读源码
- 学习后端可观测性工具(如 Grafana、Prometheus)以更好理解全貌
面试指南
- 对于架构设计类问题:先明确需求,再分层阐述(采集、传输、存储、分析),最后结合行业方案和个人经验
- 对于挑战类问题:用 STAR 方法(情境-任务-行动-结果)具体说明
- 对于技术标准类问题:展现对标准的理解,并结合实际案例说明如何克服落地难点
- 请设计一个客户端 APM 系统的架构,包括数据采集、传输、存储和分析
- Trace 在客户端到服务端如何串联?Span 模型如何定义?
- 客户端性能优化中你遇到的最大挑战是什么?如何解决?
- 如何平衡数据采集的全面性与端侧资源消耗(电量、流量)?
- 你对 OpenTelemetry 的了解?它在客户端落地的难点和解决方案?
职位点评
76
综合评分
高薪前沿技术岗位,技术挑战大,适合寻求快速成长的资深客户端专家。
从薪资福利、成长空间、工作节奏和岗位方向综合评估,方便横向比较。
更适合这类人
适合最看重技术成长和平台影响力的求职者,对工作生活平衡要求不高。
表现最好
成长发展
相对薄弱
工作生活
薪资福利85
成长发展90
工作生活50
使命价值60
薪资福利
85较高
薪资估算显示市场水准偏高,小红书福利好,但JD未明确具体薪资,需面议。
薪资信号面议 (40K-65K/月)
成长发展
90较高
该职位技术前沿,涉及可观测性体系设计,有大量成长空间,但JD未明确晋升机制。
技术前沿前沿/新兴技术
技术栈Trace、Metrics、Logs、OpenTelemetry、APM、智能诊断
业务类型ambiguous
工作生活
50较低
现场办公,工作强度和加班情况未说明,但互联网大厂通常有一定强度。
工作模式仅现场办公
办公地点市区核心地段
加班情况未提及(无法判断)
使命价值
60中等
岗位属于技术基础设施,社会影响中性,行业增长快但JD未强调使命感。
行业发展高速增长赛道
社会影响中性/一般
创新程度积极采用新技术
小红书 的其他在招职位
相似职位推荐
Watch Jobs