尧图精选

开源 AIOps 告警管理平台 Keep:5 分钟部署,把告警收敛成一次处置

🕒 发布时间:2026/9/14 10:56:13 📁 来源:尧图网络
开源 AIOps 告警管理平台 Keep5 分钟部署把告警收敛成一次处置【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨三点你被第 7 条告警叫醒而前 6 条其实是同一个故障。这就是很多团队的日常Prometheus、Datadog、CloudWatch 各报各的一件事被重复通知好几遍。开源的 AIOps 告警管理平台 Keep做的事是把散落各处的告警收进一个界面用 AI 把相关的那几条归拢成一个事件再用工作流把谁来处理这一步自动化。下面带你从 0 把它跑起来、连上第一个监控源再把 AI 关联、服务拓扑、自然语言工作流这几样真正省心的能力拆开看最后聊上生产前必须做的事。全程以你能照着敲为标准。告警风暴来了你第一眼看到的是哪一条先说痛点告警散在好几个工具里同一故障被通知好几遍你得在多个控制台之间来回切。Keep 想解决的正是这件事——不是再加一个监控工具而是把已有工具产生的告警管起来。它到底在替你管什么可以把它理解成告警的总控台各系统的告警统一进来重复的合并、相关的关联、该自动化的自动化你只看真正需要动手的那部分。官方口径是能砍掉约 90% 的无效通知数字见仁见智但把噪音降下来、把动作接上去这个方向是清楚的。落到界面上就是能按严重度、状态、负责人多维筛选同一张表还支持批量操作。从 0 到能看到告警5 分钟跑通 Keep这一节只干一件事让你在几分钟内打开浏览器看到第一条真实告警。第一步把容器拉起来最简单的方式是 Docker Compose。克隆仓库后起前端、后端、实时推送三个服务几分钟后界面就能访问。git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep docker compose up -d起来后浏览器打开http://localhost:3000就是界面。默认是免登录NO_AUTH模式方便先体验如果你用带鉴权的 compose 文件初始账号密码是 keep/keep。数据默认落在本地 SQLite不用额外准备数据库。第二步接入第一个监控源打开界面里的 Providers 页面挑一个你最常用的Prometheus、Datadog、Grafana 都行跟着向导填上凭据即可。连上之后告警会自动同步进来切到 Alerts 页面就能看到它们躺在同一张表里。整个过程就是选工具 → 填配置 → 看结果。第三步把 AI 开关打开AI 关联和自然语言工作流都依赖大模型。在后端环境变量里加上OPENAI_API_KEY这两项就从灰着的按钮变成能用的功能。顺手把DATABASE_CONNECTION_STRING指到正式数据库、给鉴权场景配好KEEP_JWT_SECRET基本就是能上生产的最小配置了。三个让值班更省心的能力跑通只是开始下面这三样才是它区别于又一个看板的地方。相关告警自动聚成一个事件数据库超时、接口变慢、用户开始投诉——分开看是三条合起来往往是一个问题。Keep 的 AI 关联会分析时间序列、拓扑关系和历史模式把相关的那几条归拢成一个事件还能给出根因提示。你面对的是一个故障而不是一堆红点。一张图看清谁依赖谁微服务时代最怕改了 A 会不会打挂 B。服务拓扑会把组件之间的依赖自动画出来某个节点出问题时你能直接看到影响半径——上下游谁会被波及一眼看清。说一句人话工作流就配好了不想写 YAML那就用大白话说。你输入每分钟查 CloudWatch 日志里的错误发现就发 Slack 通知AI 助手直接把触发器和步骤都填好。你可以再改但骨架它已经帮你搭好了。把处置流程写成 YAML告警来了自动修AI 能帮你配出来但想长期稳定跑得有一份你能看懂、能改的工作流。Keep 的工作流是两段式触发器决定什么情况下跑步骤决定跑了做什么。触发器 步骤两段就够触发器通常按告警字段过滤比如 source 是 kubernetes步骤则按顺序执行可以带条件——用if判断某一步的输出再决定走不走下一步。支持跨工具联动也能用 Python 做点逻辑判断。真实例子Pod 挂了自动重启下面是一个精简版告警来自 Kubernetes → 取 Pod 状态 → 判断要不要重启 → 删掉让它自愈。workflow: id: auto-heal-k8s-pods name: K8s Pod 自愈 triggers: - type: alert filters: - field: source operator: equals value: kubernetes steps: - name: get_pod_status provider: type: kubernetes with: action: get_pod_details - name: restart_pod if: {{ steps.get_pod_status.output.needs_restart }} provider: type: kubernetes with: action: delete_pod更多现成写法Jira、Slack、Datadog、Grafana 等都在examples/workflows/里照着抄最省事。什么时候用什么时候别用适合重复且动作固定的处置重启、建工单、升级通知、跨系统联动。不适合一次性的临时查询、逻辑特别复杂的判断——那种直接写脚本更清楚。原则是下次还会遇到、且动作固定的才值得做成工作流。上生产前先把这几件事做对体验版用 SQLite、免登录都没问题真要长期跑这几件事得一件件过。K8s 上用 Helm 一键装生产环境推荐走 Kubernetes Helm。先加官方仓库再装进一个命名空间装完用 ingress 拿地址访问。helm repo add keephq https://keephq.github.io/helm-charts helm install keep keephq/keep -n keep --create-namespace装完执行kubectl -n keep get ingress拿到入口地址想开 HTTPS给 ingress 配上 TLS secret 再 upgrade 一下即可。常见踩坑与排查命令端口占用3000UI、8080API、6001推送冲突时先看谁占了再改端口。服务死活docker compose ps看状态docker compose logs keep-backend看日志。数据在哪默认 SQLite 落在./state/db.sqlite3出问题先确认这个文件和对应容器是否正常。安全与性能四件事别省改掉默认密码keep/keep生产环境开 HTTPS。用 RBAC 控制谁能看、谁能改别所有人一个权限。数据库上独立实例 合适索引告警量大时把 Redis 缓存、批量写入、异步队列用起来。定期备份数据库开审计日志并定期回看。Keep 的开源属性意味着数据握在你自己手里想改就改。如果已经跑通了体验版按下面这份清单往下走就行。打开 Providers接入你最常用的那个监控源。切到 Alerts确认告警真的进来了。配一个OPENAI_API_KEY试一下 AI 关联。照着examples/workflows/抄一个工作流跑一遍。决定上生产换正式数据库 Helm 部署 过一遍安全清单。延伸阅读docs/overview/introduction.mdx、examples/workflows/、docs/providers/overview.mdx。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →