建立性能监控与异常监控
建立性能监控与异常监控
这篇笔记还在编辑中,内容可能会继续补充、调整或重写。
本阶段目标
让线上问题能够回答四个问题:发生了什么、影响了多少用户、从哪个版本开始、现在应采取什么动作。监控不是尽可能多地采集数据,而是建立从发现到恢复的闭环。
最小事件模型
错误事件至少包含:
- 事件时间、页面和标准化路由
- 发布版本、环境和构建标识
- 错误类型、消息和还原后的堆栈
- 匿名会话或关联标识
- 最近关键业务事件
- 浏览器、设备和网络上下文
不要采集令牌、密码、完整请求正文或不必要的个人数据。URL、日志、面包屑和录屏同样需要脱敏。
接入两类信号
- 异常:同步错误、未处理 Promise、资源加载失败和接口异常。
- 体验:LCP、INP、CLS、导航耗时、长任务和关键业务成功率。
指标应按版本、路由、设备和网络分组,并使用真实用户分位数而不是只看平均值。实验室工具适合复现,RUM 用来发现真实分布和长尾问题。
Source Map 与发布
构建生成不公开引用的 Source Map,上传到监控平台后再部署制品。上传时使用与事件完全一致的版本标识,并在发布后主动触发一次测试异常验证映射。
告警演练
- 发布一个只在特定路由触发的异常,验证去重、版本定位和 Source Map 还原。
- 注入慢请求和长任务,观察性能分布而不是单次结果。
- 为“任务创建失败率”设置基于用户影响的告警,确认告警包含负责人和排查入口。
验收标准
- 测试异常能还原到正确源码和提交版本
- 同一错误会合理聚合,同时保留版本与环境维度
- 仪表盘能展示 LCP、INP、CLS 的第 75 百分位
- 采集规则经过隐私和成本检查
- 至少演练一次告警确认、定位、恢复和复盘流程
下一篇:抽取组件库与共享配置。