SKILL.md
只读
名称
qdrant-monitoring-setup
描述
指导 Qdrant 监控设置,包括 Prometheus 抓取、健康探针、混合云指标、告警和日志集中。当有人询问“如何设置监控”、“Prometheus 配置”、“Grafana 仪表板”、“健康检查端点”、“如何抓取混合云”、“设置哪些告警”、“如何集中日志”或“审计日志”时使用。
如何设置 Qdrant 监控
先让 Prometheus 抓取工作,然后是健康探针,最后是告警。在进入生产环境之前,不要跳过监控设置。
Prometheus 指标
何时使用:首次设置指标收集或添加新部署时。
- 节点指标位于
/metrics端点 监控文档 - 集群指标位于
/sys_metrics(仅限 Qdrant Cloud) - 通过
service.metrics_prefix配置或QDRANT__SERVICE__METRICS_PREFIX环境变量自定义前缀 - 使用 Prometheus + Grafana 的自托管示例 prometheus-monitoring 仓库
混合云抓取
何时使用:运行 Qdrant Hybrid Cloud 并需要集群级可见性时。
不要只抓取 Qdrant 节点。在混合云中,您管理 Kubernetes 数据平面。您还必须抓取 cluster-exporter 和 operator pod,以获得完整的集群可见性和 operator 状态。
- 混合云 Prometheus 设置教程 混合云 Prometheus
- 官方 Grafana 仪表板 Grafana 仪表板仓库
存活和就绪探针
何时使用:配置 Kubernetes 健康检查时。
- 使用
/healthz、/livez、/readyz获取基本状态、存活和就绪 Kubernetes 健康端点
告警
何时使用:为生产或混合云部署设置告警时。
- 混合云开箱即用地提供约 11 个预配置的 Prometheus 告警 云集群监控
- 使用 AlertmanagerConfig 根据标签将告警路由到 Slack、PagerDuty 或其他目标
- 至少对以下内容设置告警:优化器错误、节点未就绪、复制因子低于目标、磁盘使用率 >80%
日志集中和审计日志
何时使用:企业合规要求集中日志或审计跟踪时。
- 启用 JSON 日志格式以进行结构化分析:在配置中将
logger.format设置为json配置 - 使用 FluentD/OpenSearch 进行日志聚合
- 审计日志(v1.17+)写入本地文件系统(
/qdrant/storage/audit/),而不是 stdout。挂载持久卷并部署 sidecar 容器将这些文件尾部输出到 stdout,以便 DaemonSet 可以拾取它们。 审计日志
不要做什么
- 在自托管上抓取
/sys_metrics(仅在 Qdrant Cloud 上可用) - 在混合云中只抓取 Qdrant 节点(会错过 cluster-exporter 和 operator 指标)
- 在进入生产环境之前跳过监控设置(您会后悔的)
- 对页缓存内存使用量设置告警(它应该填满可用 RAM,这是正常的操作系统行为)




