Keep 告警管理平台:一条命令拉起,把 2000 条告警压到 150 条

Keep 告警管理平台:一条命令拉起,把 2000 条告警压到 150 条 Keep 告警管理平台一条命令拉起把 2000 条告警压到 150 条【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨 2 点手机被同一条 payment 服务超时 告警连刷了 40 分钟。你爬起来一看其实是上游数据库连接池打满Prometheus、Datadog、Zabbix 各报各的同一个故障变成了 300 条通知。你手动翻了半天才在 Slack 里跟队友确认根因。这种告警风暴几乎每个 SRE 都经历过。Keep 是一个开源的 AIOps 和告警管理平台做的事情很直接把所有监控工具的告警收进一个界面去重、合并、再按你写的规则自动处理让 200 条噪音变成 1 条值得看的告警。几分钟拉起一条命令跑通 Keep克隆仓库后在目录里执行仓库自带的安装脚本git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep sh start.sh脚本会拉取 docker-compose 配置并启动后端、前端和 websocket 三个容器。跑起来后你首先看到的是一个空的告警列表页接下来先去 Providers 页面接一个数据源比如把 Prometheus 的告警推过来。核心能力拆解先接数据再降噪最后自动化第一步用 Provider 把监控工具接进来配好 Provider 之后你不用再为每个监控系统单独看面板所有告警都汇到同一张表里。Keep 内置了上百个 Provider接入方式分两种Webhook 推送你现有系统往 Keep 发告警和 API 拉取Keep 主动去拉。双向同步既能收告警也能回写状态到原系统配置即代码Provider 可以用 YAML 声明随仓库版本管理内置去重规则每个 Provider 自带默认指纹字段接上就能用Provider 的完整清单见 providers 集成目录。第二步告警规则怎么配才不刷屏这是你接完数据源后最先该做的事。Keep 靠指纹fingerprint判断两条告警是不是同一个问题指纹字段相同的告警会被归到一组只呈现一条。指纹字段可配按 service error_message 归组而不是整条告警全量去重字段完全相同的重复事件直接丢弃防系统被刷爆默认规则可用不配置时按 Provider 声明的字段算指纹归组后仍可下钻合并的告警保留原始上下文点进去能看到明细第三步工作流把重复操作自动化以前看到告警 → 翻文档 → 手动重启/开 Jira 单这套动作现在写成一段 YAML 就能自动跑。工作流由触发器告警到达、定时、手动 步骤查询、脚本、API 调用 条件CEL 表达式判断三部分组成。条件判断支持阈值、断言、CEL 表达式写severity critical 才通知跨系统动作一条工作流里可以查 ClickHouse、再发 Slack、再建 Jira 单富化告警在工作流里给告警补充字段比如查一下这台主机的负责人现成模板仓库里有上百个可直接改的例子照着抄最快工作流语法细节见 workflows 文档。第四步用服务拓扑定位根因告警合并之后还剩一个问题先查谁Keep 把各系统的服务依赖画成一张拓扑图节点是服务边是依赖关系。故障发生时顺着告警节点往上游找比翻文档快得多。依赖可视化谁调用谁一目了然状态着色健康与异常状态直接标在节点上多源数据Datadog、Grafana、ArgoCD 等都能作为拓扑数据源它跟谁一起用Keep 不生产告警它站在 Prometheus、Datadog 这类工具后面做聚合和自动化。最常被搭配的组合工具集成方式一句话价值Prometheus / AlertmanagerWebhook 推送指标告警的原始来源Keep 负责降噪DatadogAPI 双向同步拉取监控告警并把处理状态写回JiraProvider 动作告警直达工单不用再手敲Slack / 邮件工作流动作通知和升级策略的出口容易踩的坑 实用调参建议指纹字段决定去重效果Provider 没声明指纹字段时默认按告警名归组同一个问题的不同实例可能合不到一起先确认你接入的 Provider 用了哪些字段全量去重别乱开它会直接丢弃完全相同的重复事件如果下游流程依赖每条原始事件只用部分去重归组更稳AI 自动关联是商业版功能开源版靠规则做关联配置时别找那个 AI 关联入口state 目录就是全部数据docker compose 部署时配置和告警历史都落在 state 目录升级前先备份重装脚本会清掉它工作流触发器谨慎配定时触发 无过滤条件的组合可能高频执行上线前先手动跑一次看日志延伸资源入门概念docs/overview/introduction.mdx可抄的工作流模板examples/workflows/去重细节docs/overview/deduplication.mdx遇到问题或缺 Provider直接去仓库 Issues 提维护者响应很快。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考