ocr-document-processor

ocr-document-processor

從掃描檔、圖片和掃描的 PDF 中提取文字與結構。適用於 OCR、可搜尋 PDF、表格提取、收據解析和名片解析。

78星標
18分支
更新於 2026/4/8
SKILL.md
唯讀
名稱
ocr-document-processor
描述

從掃描檔、圖片和掃描的 PDF 中提取文字與結構。適用於 OCR、可搜尋 PDF、表格提取、收據解析和名片解析。

OCR 文件處理器

處理需要從圖片或掃描頁面還原文字的 OCR 密集型輸入。

適用情境

  • 對圖片和掃描 PDF 進行 OCR
  • 匯出可搜尋 PDF
  • 結構化提取為文字、Markdown、JSON 或 HTML
  • 從掃描材料中提取表格
  • 收據解析和名片解析

工作流程

  1. 判斷需要純 OCR、結構化提取還是特定文件解析。
  2. 若輸入有傾斜、模糊或陰影,在提取前先預處理雜訊。
  3. 使用 scripts/ocr_processor.py 處理核心 OCR 任務。
  4. 當輸入為特定類型時,使用專用輔助工具:
    • scripts/business_card_scanner.py
    • scripts/receipt_scanner.py
  5. 若來源品質低、旋轉、手寫或多語言,回傳信心度注意事項。

使用限制

  • 當準確度重要時,建議明確指定語言。
  • 若 OCR 信心度低,不要聲稱欄位完全正確。
  • 預設將非掃描的數位 PDF 導向 document-converter-suite 而非 OCR。