ocr-document-processor

ocr-document-processor

从扫描件、图像和扫描版PDF中提取文本和结构。用于OCR、可搜索PDF、表格提取、收据解析和名片解析。

78Star
18Fork
更新于 2026/4/8
SKILL.md
readonly只读
name
ocr-document-processor
description

从扫描件、图像和扫描版PDF中提取文本和结构。用于OCR、可搜索PDF、表格提取、收据解析和名片解析。

OCR文档处理器

处理OCR密集型输入,需要从图像或扫描页面中恢复文本。

适用场景

  • 对图像和扫描版PDF进行OCR
  • 导出可搜索PDF
  • 结构化提取为文本、Markdown、JSON或HTML
  • 从扫描材料中提取表格
  • 收据解析和名片解析

工作流程

  1. 判断是否需要纯OCR、结构化提取或特定文档解析。
  2. 在提取前对存在倾斜、模糊或阴影的噪声输入进行预处理。
  3. 使用 scripts/ocr_processor.py 处理核心OCR任务。
  4. 当输入为专用类型时,使用专用辅助脚本:
    • scripts/business_card_scanner.py
    • scripts/receipt_scanner.py
  5. 当来源质量低、旋转、手写或多语言时,返回置信度提示。

安全护栏

  • 当准确性重要时,优先明确指定语言。
  • 当OCR置信度较低时,不要声称字段完全准确。
  • 默认将非扫描的数字PDF路由到 document-converter-suite 而非OCR。