基建:服务告警与日志推送
wabicai
# 基建:服务告警与日志推送
# 目标
在服务异常、接口超时、关键任务失败时,能够第一时间通过日志和告警把问题暴露出来,而不是等用户反馈。
# 一套基础闭环
- 统一采集结构化日志。
- 按错误级别和业务字段进行聚合。
- 设定告警规则和阈值。
- 通过 IM、邮件或值班系统推送。
- 告警收敛后回流到问题复盘。
# 日志设计建议
- 带上
traceId、服务名、环境、接口名和错误码 - 区分业务错误与系统错误
- 不要把敏感数据直接打进日志
# 告警设计建议
- 先告警关键问题,再逐步扩展
- 避免单条错误直接群发,优先做聚合和去重
- 告警文案要能让值班同学快速定位入口
# 结论
日志解决“发生了什么”,告警解决“谁来处理”,两者必须配套建设。