SKILL.md
唯讀
名稱
ocr-document-processor
描述
從掃描檔、圖片和掃描的 PDF 中提取文字與結構。適用於 OCR、可搜尋 PDF、表格提取、收據解析和名片解析。
OCR 文件處理器
處理需要從圖片或掃描頁面還原文字的 OCR 密集型輸入。
適用情境
- 對圖片和掃描 PDF 進行 OCR
- 匯出可搜尋 PDF
- 結構化提取為文字、Markdown、JSON 或 HTML
- 從掃描材料中提取表格
- 收據解析和名片解析
工作流程
- 判斷需要純 OCR、結構化提取還是特定文件解析。
- 若輸入有傾斜、模糊或陰影,在提取前先預處理雜訊。
- 使用
scripts/ocr_processor.py處理核心 OCR 任務。 - 當輸入為特定類型時,使用專用輔助工具:
scripts/business_card_scanner.pyscripts/receipt_scanner.py
- 若來源品質低、旋轉、手寫或多語言,回傳信心度注意事項。
使用限制
- 當準確度重要時,建議明確指定語言。
- 若 OCR 信心度低,不要聲稱欄位完全正確。
- 預設將非掃描的數位 PDF 導向
document-converter-suite而非 OCR。






