SKILL.md
唯讀
名稱
qdrant-monitoring-setup
描述
引導 Qdrant 監控設定,包括 Prometheus 抓取、健康檢查探針、Hybrid Cloud 指標、警示和日誌集中化。當有人問「如何設定監控」、「Prometheus 設定」、「Grafana 儀表板」、「健康檢查端點」、「如何抓取 Hybrid Cloud」、「要設定哪些警示」、「如何集中日誌」或「稽核日誌」時使用。
如何設定 Qdrant 監控
先讓 Prometheus 抓取運作,然後是健康檢查探針,最後是警示。在進入生產環境前,不要跳過監控設定。
Prometheus 指標
使用時機:首次設定指標收集或新增部署時。
- 節點指標位於
/metrics端點 監控文件 - 叢集指標位於
/sys_metrics(僅限 Qdrant Cloud) - 前綴可透過
service.metrics_prefix設定或QDRANT__SERVICE__METRICS_PREFIX環境變數自訂 - 使用 Prometheus + Grafana 的自架範例設定 prometheus-monitoring 儲存庫
Hybrid Cloud 抓取
使用時機:執行 Qdrant Hybrid Cloud 且需要叢集層級的可視性時。
不要只抓取 Qdrant 節點。在 Hybrid Cloud 中,您管理 Kubernetes 資料平面。您也必須抓取 cluster-exporter 和 operator pods,以獲得完整的叢集可視性和 operator 狀態。
- Hybrid Cloud Prometheus 設定教學 Hybrid Cloud Prometheus
- 官方 Grafana 儀表板 Grafana 儀表板儲存庫
Liveness 和 Readiness 探針
使用時機:設定 Kubernetes 健康檢查時。
- 使用
/healthz、/livez、/readyz進行基本狀態、liveness 和 readiness 檢查 Kubernetes 健康端點
警示
使用時機:為生產或 Hybrid Cloud 部署設定警示時。
- Hybrid Cloud 開箱即用提供約 11 個預先設定的 Prometheus 警示 Cloud 叢集監控
- 使用 AlertmanagerConfig 根據標籤將警示路由到 Slack、PagerDuty 或其他目標
- 至少警示以下項目:最佳化器錯誤、節點未就緒、複製因子低於目標、磁碟使用率 >80%
日誌集中化和稽核日誌
使用時機:企業合規要求集中日誌或稽核軌跡時。
- 啟用 JSON 日誌格式以進行結構化分析:在設定中將
logger.format設為json設定 - 使用 FluentD/OpenSearch 進行日誌聚合
- 稽核日誌(v1.17+)寫入本機檔案系統(
/qdrant/storage/audit/),而非 stdout。掛載 Persistent Volume 並部署 sidecar 容器將這些檔案輸出到 stdout,以便 DaemonSets 可以收集。 稽核日誌
不該做的事
- 在自架環境抓取
/sys_metrics(僅在 Qdrant Cloud 上可用) - 在 Hybrid Cloud 中只抓取 Qdrant 節點(會遺漏 cluster-exporter 和 operator 指標)
- 在進入生產環境前跳過監控設定(您會後悔的)
- 對 page cache 記憶體使用量發出警示(它本來就應該填滿可用 RAM,這是正常的作業系統行為)




