qdrant-monitoring-setup

qdrant-monitoring-setup

热门

指导 Qdrant 监控设置,包括 Prometheus 抓取、健康探针、混合云指标、告警和日志集中。当有人询问“如何设置监控”、“Prometheus 配置”、“Grafana 仪表板”、“健康检查端点”、“如何抓取混合云”、“设置哪些告警”、“如何集中日志”或“审计日志”时使用。

227Star
28Fork
更新于 2026/8/28
SKILL.md
只读
名称
qdrant-monitoring-setup
描述

指导 Qdrant 监控设置,包括 Prometheus 抓取、健康探针、混合云指标、告警和日志集中。当有人询问“如何设置监控”、“Prometheus 配置”、“Grafana 仪表板”、“健康检查端点”、“如何抓取混合云”、“设置哪些告警”、“如何集中日志”或“审计日志”时使用。

如何设置 Qdrant 监控

先让 Prometheus 抓取工作,然后是健康探针,最后是告警。在进入生产环境之前,不要跳过监控设置。

Prometheus 指标

何时使用:首次设置指标收集或添加新部署时。

  • 节点指标位于 /metrics 端点 监控文档
  • 集群指标位于 /sys_metrics(仅限 Qdrant Cloud)
  • 通过 service.metrics_prefix 配置或 QDRANT__SERVICE__METRICS_PREFIX 环境变量自定义前缀
  • 使用 Prometheus + Grafana 的自托管示例 prometheus-monitoring 仓库

混合云抓取

何时使用:运行 Qdrant Hybrid Cloud 并需要集群级可见性时。

不要只抓取 Qdrant 节点。在混合云中,您管理 Kubernetes 数据平面。您还必须抓取 cluster-exporter 和 operator pod,以获得完整的集群可见性和 operator 状态。

存活和就绪探针

何时使用:配置 Kubernetes 健康检查时。

告警

何时使用:为生产或混合云部署设置告警时。

  • 混合云开箱即用地提供约 11 个预配置的 Prometheus 告警 云集群监控
  • 使用 AlertmanagerConfig 根据标签将告警路由到 Slack、PagerDuty 或其他目标
  • 至少对以下内容设置告警:优化器错误、节点未就绪、复制因子低于目标、磁盘使用率 >80%

日志集中和审计日志

何时使用:企业合规要求集中日志或审计跟踪时。

  • 启用 JSON 日志格式以进行结构化分析:在配置中将 logger.format 设置为 json 配置
  • 使用 FluentD/OpenSearch 进行日志聚合
  • 审计日志(v1.17+)写入本地文件系统(/qdrant/storage/audit/),而不是 stdout。挂载持久卷并部署 sidecar 容器将这些文件尾部输出到 stdout,以便 DaemonSet 可以拾取它们。 审计日志

不要做什么

  • 在自托管上抓取 /sys_metrics(仅在 Qdrant Cloud 上可用)
  • 在混合云中只抓取 Qdrant 节点(会错过 cluster-exporter 和 operator 指标)
  • 在进入生产环境之前跳过监控设置(您会后悔的)
  • 对页缓存内存使用量设置告警(它应该填满可用 RAM,这是正常的操作系统行为)