qdrant-monitoring-setup

qdrant-monitoring-setup

熱門

引導 Qdrant 監控設定,包括 Prometheus 抓取、健康檢查探針、Hybrid Cloud 指標、警示和日誌集中化。當有人問「如何設定監控」、「Prometheus 設定」、「Grafana 儀表板」、「健康檢查端點」、「如何抓取 Hybrid Cloud」、「要設定哪些警示」、「如何集中日誌」或「稽核日誌」時使用。

227星標
28分支
更新於 2026/8/28
SKILL.md
唯讀
名稱
qdrant-monitoring-setup
描述

引導 Qdrant 監控設定,包括 Prometheus 抓取、健康檢查探針、Hybrid Cloud 指標、警示和日誌集中化。當有人問「如何設定監控」、「Prometheus 設定」、「Grafana 儀表板」、「健康檢查端點」、「如何抓取 Hybrid Cloud」、「要設定哪些警示」、「如何集中日誌」或「稽核日誌」時使用。

如何設定 Qdrant 監控

先讓 Prometheus 抓取運作,然後是健康檢查探針,最後是警示。在進入生產環境前,不要跳過監控設定。

Prometheus 指標

使用時機:首次設定指標收集或新增部署時。

  • 節點指標位於 /metrics 端點 監控文件
  • 叢集指標位於 /sys_metrics(僅限 Qdrant Cloud)
  • 前綴可透過 service.metrics_prefix 設定或 QDRANT__SERVICE__METRICS_PREFIX 環境變數自訂
  • 使用 Prometheus + Grafana 的自架範例設定 prometheus-monitoring 儲存庫

Hybrid Cloud 抓取

使用時機:執行 Qdrant Hybrid Cloud 且需要叢集層級的可視性時。

不要只抓取 Qdrant 節點。在 Hybrid Cloud 中,您管理 Kubernetes 資料平面。您也必須抓取 cluster-exporter 和 operator pods,以獲得完整的叢集可視性和 operator 狀態。

Liveness 和 Readiness 探針

使用時機:設定 Kubernetes 健康檢查時。

警示

使用時機:為生產或 Hybrid Cloud 部署設定警示時。

  • Hybrid Cloud 開箱即用提供約 11 個預先設定的 Prometheus 警示 Cloud 叢集監控
  • 使用 AlertmanagerConfig 根據標籤將警示路由到 Slack、PagerDuty 或其他目標
  • 至少警示以下項目:最佳化器錯誤、節點未就緒、複製因子低於目標、磁碟使用率 >80%

日誌集中化和稽核日誌

使用時機:企業合規要求集中日誌或稽核軌跡時。

  • 啟用 JSON 日誌格式以進行結構化分析:在設定中將 logger.format 設為 json 設定
  • 使用 FluentD/OpenSearch 進行日誌聚合
  • 稽核日誌(v1.17+)寫入本機檔案系統(/qdrant/storage/audit/),而非 stdout。掛載 Persistent Volume 並部署 sidecar 容器將這些檔案輸出到 stdout,以便 DaemonSets 可以收集。 稽核日誌

不該做的事

  • 在自架環境抓取 /sys_metrics(僅在 Qdrant Cloud 上可用)
  • 在 Hybrid Cloud 中只抓取 Qdrant 節點(會遺漏 cluster-exporter 和 operator 指標)
  • 在進入生產環境前跳過監控設定(您會後悔的)
  • 對 page cache 記憶體使用量發出警示(它本來就應該填滿可用 RAM,這是正常的作業系統行為)