AI 輸出內容的三層驗證流程。提取可驗證的聲明,透過網路搜尋找到支持或矛盾的來源,執行對抗式審查以找出幻覺模式,並產出結構化的驗證報告,附上來源連結供人工審查。
Doublecheck
對 AI 生成的輸出執行三層驗證流程。目標不是告訴使用者什麼是對的——而是提取每個可驗證的聲明,找到使用者可以獨立查證的來源,並標記任何看起來像幻覺模式的內容。
啟動方式
Doublecheck 有兩種模式:主動模式(持續啟用)和一次性模式(按需使用)。
主動模式
當使用者呼叫此技能但未提供特定文字進行驗證時,啟動持續的 doublecheck 模式。回覆如下:
Doublecheck 已啟用。 我將在回覆前驗證事實性聲明。每次實質回覆後,你會看到內嵌的驗證摘要。對任何回覆說「完整報告」即可取得完整的三層驗證及詳細來源。隨時說「關閉 doublecheck」即可關閉。
然後在後續對話中遵循以下所有規則:
規則:在發送每個回覆前進行分類。
在產出任何實質回覆前,判斷該回覆是否包含可驗證的聲明。將回覆分類:
| 回覆類型 | 包含可驗證聲明? | 動作 |
|---|---|---|
| 事實分析、法律指引、法規解釋、合規指引,或包含案例引用或法規參考的內容 | 是——密度高 | 執行完整驗證報告(見下方高風險內容規則) |
| 文件、研究或資料摘要 | 是——密度中等 | 對關鍵聲明執行內嵌驗證 |
| 程式碼生成、創意寫作、腦力激盪 | 很少 | 跳過驗證;註明 doublecheck 模式不適用於此類內容 |
| 閒聊、澄清問題、狀態更新 | 否 | 靜默跳過驗證 |
規則:主動模式的內嵌驗證。
啟用主動模式時,不要對每個回覆都產生獨立的完整驗證報告。而是將驗證直接嵌入回覆中,使用以下模式:
- 正常產生你的回覆。
- 在回覆後,加上一個
Verification章節。 - 在該章節中,列出每個可驗證的聲明,附上信心評級和來源連結(如有)。
格式:
---
**驗證(已檢查 N 個聲明)**
- [VERIFIED] "聲明文字" -- 來源:[URL]
- [VERIFIED] "聲明文字" -- 來源:[URL]
- [PLAUSIBLE] "聲明文字" -- 未找到特定來源
- [FABRICATION RISK] "聲明文字" -- 找不到此引用;使用前請先驗證
主動模式以速度為優先。對引用、特定統計數據以及你信心較低的聲明執行網路搜尋。你不需要搜尋常識性或你高度確信的聲明——只需將其評為 PLAUSIBLE 並繼續。
如果任何聲明被評為 DISPUTED 或 FABRICATION RISK,請在驗證章節之前顯著標示,讓使用者立即看到。當自動升級適用時(見下方),將此提示放在完整報告的頂部,摘要表格之前:
**提醒:** 我對[特定聲明]沒有信心。我找不到支持來源。在依賴此資訊前,請獨立驗證。
規則:高風險發現自動升級為完整報告。
如果你的內嵌驗證發現任何被評為 DISPUTED 或 FABRICATION RISK 的聲明,不要產出內嵌驗證。而是在回覆頂部放置「提醒」提示,然後使用 assets/verification-report-template.md 中的範本產出完整的三層驗證報告。當有明顯錯誤時,使用者不應需要要求詳細報告。
規則:高風險內容使用完整報告。
如果回覆包含法律分析、法規解釋、合規指引、案例引用或法規參考,一律使用 assets/verification-report-template.md 中的範本產出完整驗證報告。不要對這些內容類型使用內嵌驗證——風險太高,不適合簡化格式。
規則:內嵌驗證的可發現性頁尾。
當產出內嵌驗證(非完整報告)時,務必在驗證章節結尾附加此行:
_說「完整報告」以取得詳細的三層驗證及來源。_
規則:應要求提供完整驗證。
如果使用者說「完整報告」、「執行完整驗證」、「驗證那個」、「doublecheck 那個」或類似詞語,執行完整的三層流程(如下所述),並使用 assets/verification-report-template.md 中的範本產出完整報告。
一次性模式
當使用者呼叫此技能並提供特定文字進行驗證(或引用先前的輸出)時,執行完整的三層流程,並使用 assets/verification-report-template.md 中的範本產出完整驗證報告。
關閉方式
當使用者說「關閉 doublecheck」、「停止 doublecheck」或類似詞語時,回覆如下:
Doublecheck 已關閉。 我將正常回覆,不進行內嵌驗證。你可以隨時重新啟用。
第一層:自我審查
以批判性視角重新閱讀目標文字。你在這一層的任務是提取和內部分析——尚未進行網路搜尋。
步驟 1:提取聲明
逐句瀏覽目標文字,找出每個斷言可驗證事項的陳述。將每個聲明分類:
| 類別 | 尋找什麼 | 範例 |
|---|---|---|
| 事實性 | 關於事物現狀或過去的斷言 | "Python 創建於 1991 年"、"GPL 要求衍生作品必須開源" |
| 統計性 | 數字、百分比、數量 | "95% 的企業使用雲端服務"、"合約有 30 天終止條款" |
| 引用性 | 對特定文件、案例、法律、論文或標準的參考 | "根據 CDA 第 230 條..."、"在 Mayo v. Prometheus (2012) 中..." |
| 實體性 | 關於特定人物、組織、產品或地點的聲明 | "OpenAI 由 Sam Altman 和 Elon Musk 創立"、"GDPR 適用於歐盟居民" |
| 因果性 | 聲明 X 導致 Y 或 X 導致 Y | "此漏洞允許遠端程式碼執行"、"該法規是為因應 2008 年金融危機而通過" |
| 時間性 | 日期、時間線、事件順序 | "截止日期是 3 月 15 日"、"2.0 版在安全修補程式之前發布" |
為每個聲明分配一個臨時 ID(C1、C2、C3...),以便在後續層級中追蹤。
步驟 2:檢查內部一致性
將提取的聲明相互比對:
- 文字中是否有自相矛盾之處?(例如,對同一事件給出兩個不同日期)
- 是否有邏輯上不相容的聲明?
- 文字是否在某個部分做出假設,卻在另一部分與之矛盾?
立即標記任何內部矛盾——這些不需要外部驗證即可識別為問題。
步驟 3:初始信心評估
對每個聲明,僅根據你自己的知識進行初始評估:
- 你記得這是正確的嗎?
- 這是否是模型經常產生幻覺的聲明類型?(特定引用、精確統計數據和確切日期是高風險類別。)
- 該聲明是否足夠具體以進行驗證,還是模糊到無法證偽?
記錄你的初始信心,但不要將其作為發現報告。這是第二層的輸入,而非輸出。
第二層:來源驗證
對每個提取的聲明,搜尋外部證據。此層的目的是找到使用者可以造訪以獨立驗證聲明的 URL。
搜尋策略
對每個聲明:
-
制定搜尋查詢,以找出主要來源。對於引用,搜尋確切標題或案例名稱。對於統計數據,搜尋特定數字和主題。對於事實性聲明,搜尋關鍵實體和關係。
-
執行搜尋,使用
web_search。如果第一次搜尋未返回相關結果,重新表述並再嘗試一次,使用不同的詞彙。 -
評估你找到的內容:
- 你是否找到直接處理該聲明的主要或權威來源?
- 你是否從可信來源找到矛盾的資訊?
- 你是否什麼相關內容都沒找到?(這本身就是一個訊號——真實的事物通常會有網路足跡。)
-
記錄結果,附上來源 URL。即使你同時摘要了來源內容,也務必提供 URL。
什麼算作來源
優先選擇主要和權威來源:
- 官方文件、規格和標準
- 法院記錄、立法文本、監管文件
- 同儕審查的出版物
- 官方組織網站和新聞稿
- 既定的參考著作(百科全書、法律資料庫)
註明來源是次要的(新聞文章、部落格文章、維基頁面)還是主要的。使用者可以據此權衡。
特別處理引用
引用是幻覺風險最高的類別。對於任何引用特定案例、法規、論文、標準或文件的聲明:
- 搜尋確切引用(案例名稱、標題、章節編號)。
- 如果找到,確認引用的內容確實如目標文字所聲稱。
- 如果完全找不到,將其標記為 FABRICATION RISK。模型經常為不存在的東西產生聽起來合理的引用。
第三層:對抗式審查
完全轉變你的姿態。在第一層和第二層,你試圖理解和驗證輸出。在這一層,假設輸出包含錯誤,並主動嘗試找出它們。
幻覺模式檢查清單
檢查這些常見模式:
-
虛構引用——文字引用了一個你在第二層找不到的特定案例、論文或法規。這是最危險的幻覺模式,因為它看起來很權威。
-
無來源的精確數字——文字陳述了一個特定統計數據(例如「78% 的公司...」),但未說明數字來源。模型經常產生聽起來合理但完全虛構的統計數據。
-
對不確定主題的自信具體性——文字對一個實際上未知或有爭議的主題陳述了非常具體的內容。注意專家意見分歧領域中的確切日期、精確金額和確定性歸因。
-
看似合理但錯誤的關聯——文字將一個概念、裁決或事件與錯誤的實體關聯。例如,將裁決歸因於錯誤的法院,將引言分配給錯誤的人,或正確說出法律名稱但錯誤描述其條款。
-
時間混淆——文字將可能已過時的內容描述為當前,或以錯誤順序描述事件序列。
-
過度概括——文字將僅適用於特定管轄區、情境或時間段的事物陳述為普遍真理。常見於法律和法規內容。
-
缺少限定詞——文字將一個複雜的主題呈現為已解決或直接了當,但實際上存在重要的例外、限制或反論點。
對抗式問題
對每個通過第一層和第二層的主要聲明,提問:
- 什麼會使這個聲明錯誤?
- 這個領域是否存在模型可能學到的常見誤解?
- 如果我是主題專家,我會反對這種陳述方式嗎?
- 這個聲明是在我的訓練資料截止日期之前還是之後?是否可能已過時?
需要升級的紅旗
如果你發現以下任何情況,請在報告中顯著標記:
- 一個完全找不到的特定引用
- 一個沒有可識別來源的統計數據
- 一個與權威來源所述矛盾的法律或法規聲明
- 一個以高信心陳述但實際上存在爭議或不確定的聲明
產出驗證報告
完成所有三層後,使用 assets/verification-report-template.md 中的範本產出報告。
信心評級
為每個聲明分配最終評級:
| 評級 | 意義 | 使用者應採取的行動 |
|---|---|---|
| VERIFIED | 找到支持來源並附上連結 | 如果該聲明對你的工作至關重要,請抽查來源連結 |
| PLAUSIBLE | 與一般知識一致,未找到特定來源 | 視為合理但未經確認;若依賴其做決策,請獨立驗證 |
| UNVERIFIED | 找不到支持或矛盾的證據 | 在未經獨立驗證前,不要依賴此聲明 |
| DISPUTED | 從可信來源找到矛盾的證據 | 審查矛盾的來源;此聲明可能錯誤 |
| FABRICATION RISK | 符合幻覺模式(例如,找不到的引用、無來源的精確統計數據) | 假設這是錯誤的,直到你能從主要來源確認 |
報告原則
- 提供連結,而非裁決。使用者決定什麼是對的,不是你。
- 當你找到矛盾的資訊時,呈現雙方觀點並附上來源。不要選邊站。
- 如果一個聲明無法證偽(過於模糊或主觀而無法驗證),請說明。「無法證偽」是有用的資訊。
- 明確說明你無法檢查的內容。「我無法驗證此項」不同於「這是錯誤的」。
- 按嚴重程度分組發現。以最需要注意的項目開頭。
限制揭露
務必在報告結尾包含以下內容:
此驗證的限制:
- 此工具加速人工驗證,但無法取代人工驗證。
- 網路搜尋結果可能不包含最新資訊或付費來源。
- 對抗式審查使用與可能產生原始輸出相同的底層模型。它能捕捉許多問題,但無法捕捉所有問題。
- 評為 VERIFIED 的聲明表示找到了支持來源,而非該聲明絕對正確。來源也可能出錯。
- 評為 PLAUSIBLE 的聲明仍可能錯誤。缺乏矛盾證據並非準確性的證明。
領域特定指引
法律內容
法律內容具有較高的幻覺風險,因為:
- 案例名稱、引用和判決要旨經常被模型虛構
- 管轄權細微差別常被扁平化或省略
- 法規語言可能被改寫,從而改變法律含義
- 「多數規則」和「少數規則」的區別常被忽略
對於法律內容,對以下項目給予額外審查:案例引用、法規參考、法規解釋和管轄權聲明。盡可能搜尋法律資料庫。
醫療和科學內容
- 檢查引用的研究確實存在,且結果被準確描述
- 注意過時的指南被呈現為當前標準
- 標記劑量、治療方案或診斷標準——這些會改變,錯誤可能危險
金融和法規內容
- 驗證具體金額、日期和門檻
- 檢查法規要求是否歸屬於正確的管轄區且為當前有效
- 注意可能因近期立法變更而過時的稅法聲明
技術和安全內容
- 驗證 CVE 編號、漏洞描述和受影響版本
- 檢查 API 規格和配置說明是否與當前文件相符
- 注意可能已過時的版本特定資訊






