SKILL.md
readonlyread-only
name
dashboard-builder
description
建立能回答實際運維人員問題的監控儀表板,適用於 Grafana、SigNoz 及類似平台。當需要將指標轉換為可用的儀表板而非虛榮面板時使用。
version
1.0.0
Dashboard Builder
當任務是建立一個可供人員操作的儀表板時使用此技能。
目標不是「顯示所有指標」,而是回答:
- 系統健康嗎?
- 瓶頸在哪裡?
- 什麼改變了?
- 應該採取什麼行動?
使用時機
- 「建立 Kafka 監控儀表板」
- 「為 Elasticsearch 建立 Grafana 儀表板」
- 「為此服務建立 SigNoz 儀表板」
- 「將這份指標清單轉換為實際的運維儀表板」
限制原則
- 不要從視覺佈局開始,而要從運維人員的問題開始
- 不要因為指標存在就全部納入
- 不要將健康、吞吐量和資源面板混雜而無結構
- 不要出廠面板卻沒有標題、單位和合理的閾值
工作流程
1. 定義運維問題
圍繞以下面向組織:
- 健康/可用性
- 延遲/效能
- 吞吐量/流量
- 飽和度/資源
- 服務特定風險
2. 研究目標平台架構
先檢查現有儀表板:
- JSON 結構
- 查詢語言
- 變數
- 閾值樣式
- 區段佈局
3. 建立最小可用儀表板
建議結構:
- 概覽
- 效能
- 資源
- 服務特定區段
4. 刪除虛榮面板
每個面板都應回答一個實際問題。如果沒有,就移除它。
範例面板組合
Elasticsearch
- 叢集健康狀態
- 分片分配
- 搜尋延遲
- 索引速率
- JVM 堆積/GC
Kafka
- Broker 數量
- 複製不足的分區
- 訊息流入/流出
- 消費者延遲
- 磁碟與網路壓力
API 閘道器/入口
- 請求速率
- p50 / p95 / p99 延遲
- 錯誤率
- 上游健康狀態
- 活躍連線數
品質檢查清單
- [ ] 有效的儀表板 JSON
- [ ] 清晰的區段分組
- [ ] 標題和單位已設定
- [ ] 閾值/狀態顏色有意義
- [ ] 存在常用篩選條件的變數
- [ ] 預設時間範圍和重新整理間隔合理
- [ ] 沒有對運維無價值的虛榮面板
相關技能
research-opsbackend-patternsterminal-ops






