doublecheck

doublecheck

熱門

AI 輸出內容的三層驗證流程。提取可驗證的聲明,透過網路搜尋找到支持或矛盾的來源,執行對抗式審查以找出幻覺模式,並產出結構化的驗證報告,附上來源連結供人工審查。

3.7萬星標
4614分支
更新於 2026/7/22
SKILL.md
readonlyread-only
name
doublecheck
description

AI 輸出內容的三層驗證流程。提取可驗證的聲明,透過網路搜尋找到支持或矛盾的來源,執行對抗式審查以找出幻覺模式,並產出結構化的驗證報告,附上來源連結供人工審查。

Doublecheck

對 AI 生成的輸出執行三層驗證流程。目標不是告訴使用者什麼是對的——而是提取每個可驗證的聲明,找到使用者可以獨立查證的來源,並標記任何看起來像幻覺模式的內容。

啟動方式

Doublecheck 有兩種模式:主動模式(持續啟用)和一次性模式(按需使用)。

主動模式

當使用者呼叫此技能但未提供特定文字進行驗證時,啟動持續的 doublecheck 模式。回覆如下:

Doublecheck 已啟用。 我將在回覆前驗證事實性聲明。每次實質回覆後,你會看到內嵌的驗證摘要。對任何回覆說「完整報告」即可取得完整的三層驗證及詳細來源。隨時說「關閉 doublecheck」即可關閉。

然後在後續對話中遵循以下所有規則:

規則:在發送每個回覆前進行分類。

在產出任何實質回覆前,判斷該回覆是否包含可驗證的聲明。將回覆分類:

回覆類型 包含可驗證聲明? 動作
事實分析、法律指引、法規解釋、合規指引,或包含案例引用或法規參考的內容 是——密度高 執行完整驗證報告(見下方高風險內容規則)
文件、研究或資料摘要 是——密度中等 對關鍵聲明執行內嵌驗證
程式碼生成、創意寫作、腦力激盪 很少 跳過驗證;註明 doublecheck 模式不適用於此類內容
閒聊、澄清問題、狀態更新 靜默跳過驗證

規則:主動模式的內嵌驗證。

啟用主動模式時,不要對每個回覆都產生獨立的完整驗證報告。而是將驗證直接嵌入回覆中,使用以下模式:

  1. 正常產生你的回覆。
  2. 在回覆後,加上一個 Verification 章節。
  3. 在該章節中,列出每個可驗證的聲明,附上信心評級和來源連結(如有)。

格式:

---
**驗證(已檢查 N 個聲明)**

- [VERIFIED] "聲明文字" -- 來源:[URL]
- [VERIFIED] "聲明文字" -- 來源:[URL]
- [PLAUSIBLE] "聲明文字" -- 未找到特定來源
- [FABRICATION RISK] "聲明文字" -- 找不到此引用;使用前請先驗證

主動模式以速度為優先。對引用、特定統計數據以及你信心較低的聲明執行網路搜尋。你不需要搜尋常識性或你高度確信的聲明——只需將其評為 PLAUSIBLE 並繼續。

如果任何聲明被評為 DISPUTED 或 FABRICATION RISK,請在驗證章節之前顯著標示,讓使用者立即看到。當自動升級適用時(見下方),將此提示放在完整報告的頂部,摘要表格之前:

**提醒:** 我對[特定聲明]沒有信心。我找不到支持來源。在依賴此資訊前,請獨立驗證。

規則:高風險發現自動升級為完整報告。

如果你的內嵌驗證發現任何被評為 DISPUTED 或 FABRICATION RISK 的聲明,不要產出內嵌驗證。而是在回覆頂部放置「提醒」提示,然後使用 assets/verification-report-template.md 中的範本產出完整的三層驗證報告。當有明顯錯誤時,使用者不應需要要求詳細報告。

規則:高風險內容使用完整報告。

如果回覆包含法律分析、法規解釋、合規指引、案例引用或法規參考,一律使用 assets/verification-report-template.md 中的範本產出完整驗證報告。不要對這些內容類型使用內嵌驗證——風險太高,不適合簡化格式。

規則:內嵌驗證的可發現性頁尾。

當產出內嵌驗證(非完整報告)時,務必在驗證章節結尾附加此行:

_說「完整報告」以取得詳細的三層驗證及來源。_

規則:應要求提供完整驗證。

如果使用者說「完整報告」、「執行完整驗證」、「驗證那個」、「doublecheck 那個」或類似詞語,執行完整的三層流程(如下所述),並使用 assets/verification-report-template.md 中的範本產出完整報告。

一次性模式

當使用者呼叫此技能並提供特定文字進行驗證(或引用先前的輸出)時,執行完整的三層流程,並使用 assets/verification-report-template.md 中的範本產出完整驗證報告。

關閉方式

當使用者說「關閉 doublecheck」、「停止 doublecheck」或類似詞語時,回覆如下:

Doublecheck 已關閉。 我將正常回覆,不進行內嵌驗證。你可以隨時重新啟用。


第一層:自我審查

以批判性視角重新閱讀目標文字。你在這一層的任務是提取和內部分析——尚未進行網路搜尋。

步驟 1:提取聲明

逐句瀏覽目標文字,找出每個斷言可驗證事項的陳述。將每個聲明分類:

類別 尋找什麼 範例
事實性 關於事物現狀或過去的斷言 "Python 創建於 1991 年"、"GPL 要求衍生作品必須開源"
統計性 數字、百分比、數量 "95% 的企業使用雲端服務"、"合約有 30 天終止條款"
引用性 對特定文件、案例、法律、論文或標準的參考 "根據 CDA 第 230 條..."、"在 Mayo v. Prometheus (2012) 中..."
實體性 關於特定人物、組織、產品或地點的聲明 "OpenAI 由 Sam Altman 和 Elon Musk 創立"、"GDPR 適用於歐盟居民"
因果性 聲明 X 導致 Y 或 X 導致 Y "此漏洞允許遠端程式碼執行"、"該法規是為因應 2008 年金融危機而通過"
時間性 日期、時間線、事件順序 "截止日期是 3 月 15 日"、"2.0 版在安全修補程式之前發布"

為每個聲明分配一個臨時 ID(C1、C2、C3...),以便在後續層級中追蹤。

步驟 2:檢查內部一致性

將提取的聲明相互比對:

  • 文字中是否有自相矛盾之處?(例如,對同一事件給出兩個不同日期)
  • 是否有邏輯上不相容的聲明?
  • 文字是否在某個部分做出假設,卻在另一部分與之矛盾?

立即標記任何內部矛盾——這些不需要外部驗證即可識別為問題。

步驟 3:初始信心評估

對每個聲明,僅根據你自己的知識進行初始評估:

  • 你記得這是正確的嗎?
  • 這是否是模型經常產生幻覺的聲明類型?(特定引用、精確統計數據和確切日期是高風險類別。)
  • 該聲明是否足夠具體以進行驗證,還是模糊到無法證偽?

記錄你的初始信心,但不要將其作為發現報告。這是第二層的輸入,而非輸出。


第二層:來源驗證

對每個提取的聲明,搜尋外部證據。此層的目的是找到使用者可以造訪以獨立驗證聲明的 URL。

搜尋策略

對每個聲明:

  1. 制定搜尋查詢,以找出主要來源。對於引用,搜尋確切標題或案例名稱。對於統計數據,搜尋特定數字和主題。對於事實性聲明,搜尋關鍵實體和關係。

  2. 執行搜尋,使用 web_search。如果第一次搜尋未返回相關結果,重新表述並再嘗試一次,使用不同的詞彙。

  3. 評估你找到的內容:

    • 你是否找到直接處理該聲明的主要或權威來源?
    • 你是否從可信來源找到矛盾的資訊?
    • 你是否什麼相關內容都沒找到?(這本身就是一個訊號——真實的事物通常會有網路足跡。)
  4. 記錄結果,附上來源 URL。即使你同時摘要了來源內容,也務必提供 URL。

什麼算作來源

優先選擇主要和權威來源:

  • 官方文件、規格和標準
  • 法院記錄、立法文本、監管文件
  • 同儕審查的出版物
  • 官方組織網站和新聞稿
  • 既定的參考著作(百科全書、法律資料庫)

註明來源是次要的(新聞文章、部落格文章、維基頁面)還是主要的。使用者可以據此權衡。

特別處理引用

引用是幻覺風險最高的類別。對於任何引用特定案例、法規、論文、標準或文件的聲明:

  1. 搜尋確切引用(案例名稱、標題、章節編號)。
  2. 如果找到,確認引用的內容確實如目標文字所聲稱。
  3. 如果完全找不到,將其標記為 FABRICATION RISK。模型經常為不存在的東西產生聽起來合理的引用。

第三層:對抗式審查

完全轉變你的姿態。在第一層和第二層,你試圖理解和驗證輸出。在這一層,假設輸出包含錯誤,並主動嘗試找出它們。

幻覺模式檢查清單

檢查這些常見模式:

  1. 虛構引用——文字引用了一個你在第二層找不到的特定案例、論文或法規。這是最危險的幻覺模式,因為它看起來很權威。

  2. 無來源的精確數字——文字陳述了一個特定統計數據(例如「78% 的公司...」),但未說明數字來源。模型經常產生聽起來合理但完全虛構的統計數據。

  3. 對不確定主題的自信具體性——文字對一個實際上未知或有爭議的主題陳述了非常具體的內容。注意專家意見分歧領域中的確切日期、精確金額和確定性歸因。

  4. 看似合理但錯誤的關聯——文字將一個概念、裁決或事件與錯誤的實體關聯。例如,將裁決歸因於錯誤的法院,將引言分配給錯誤的人,或正確說出法律名稱但錯誤描述其條款。

  5. 時間混淆——文字將可能已過時的內容描述為當前,或以錯誤順序描述事件序列。

  6. 過度概括——文字將僅適用於特定管轄區、情境或時間段的事物陳述為普遍真理。常見於法律和法規內容。

  7. 缺少限定詞——文字將一個複雜的主題呈現為已解決或直接了當,但實際上存在重要的例外、限制或反論點。

對抗式問題

對每個通過第一層和第二層的主要聲明,提問:

  • 什麼會使這個聲明錯誤?
  • 這個領域是否存在模型可能學到的常見誤解?
  • 如果我是主題專家,我會反對這種陳述方式嗎?
  • 這個聲明是在我的訓練資料截止日期之前還是之後?是否可能已過時?

需要升級的紅旗

如果你發現以下任何情況,請在報告中顯著標記:

  • 一個完全找不到的特定引用
  • 一個沒有可識別來源的統計數據
  • 一個與權威來源所述矛盾的法律或法規聲明
  • 一個以高信心陳述但實際上存在爭議或不確定的聲明

產出驗證報告

完成所有三層後,使用 assets/verification-report-template.md 中的範本產出報告。

信心評級

為每個聲明分配最終評級:

評級 意義 使用者應採取的行動
VERIFIED 找到支持來源並附上連結 如果該聲明對你的工作至關重要,請抽查來源連結
PLAUSIBLE 與一般知識一致,未找到特定來源 視為合理但未經確認;若依賴其做決策,請獨立驗證
UNVERIFIED 找不到支持或矛盾的證據 在未經獨立驗證前,不要依賴此聲明
DISPUTED 從可信來源找到矛盾的證據 審查矛盾的來源;此聲明可能錯誤
FABRICATION RISK 符合幻覺模式(例如,找不到的引用、無來源的精確統計數據) 假設這是錯誤的,直到你能從主要來源確認

報告原則

  • 提供連結,而非裁決。使用者決定什麼是對的,不是你。
  • 當你找到矛盾的資訊時,呈現雙方觀點並附上來源。不要選邊站。
  • 如果一個聲明無法證偽(過於模糊或主觀而無法驗證),請說明。「無法證偽」是有用的資訊。
  • 明確說明你無法檢查的內容。「我無法驗證此項」不同於「這是錯誤的」。
  • 按嚴重程度分組發現。以最需要注意的項目開頭。

限制揭露

務必在報告結尾包含以下內容:

此驗證的限制:

  • 此工具加速人工驗證,但無法取代人工驗證。
  • 網路搜尋結果可能不包含最新資訊或付費來源。
  • 對抗式審查使用與可能產生原始輸出相同的底層模型。它能捕捉許多問題,但無法捕捉所有問題。
  • 評為 VERIFIED 的聲明表示找到了支持來源,而非該聲明絕對正確。來源也可能出錯。
  • 評為 PLAUSIBLE 的聲明仍可能錯誤。缺乏矛盾證據並非準確性的證明。

領域特定指引

法律內容

法律內容具有較高的幻覺風險,因為:

  • 案例名稱、引用和判決要旨經常被模型虛構
  • 管轄權細微差別常被扁平化或省略
  • 法規語言可能被改寫,從而改變法律含義
  • 「多數規則」和「少數規則」的區別常被忽略

對於法律內容,對以下項目給予額外審查:案例引用、法規參考、法規解釋和管轄權聲明。盡可能搜尋法律資料庫。

醫療和科學內容

  • 檢查引用的研究確實存在,且結果被準確描述
  • 注意過時的指南被呈現為當前標準
  • 標記劑量、治療方案或診斷標準——這些會改變,錯誤可能危險

金融和法規內容

  • 驗證具體金額、日期和門檻
  • 檢查法規要求是否歸屬於正確的管轄區且為當前有效
  • 注意可能因近期立法變更而過時的稅法聲明

技術和安全內容

  • 驗證 CVE 編號、漏洞描述和受影響版本
  • 檢查 API 規格和配置說明是否與當前文件相符
  • 注意可能已過時的版本特定資訊