SKILL.md
readonly只读
name
ocr-document-processor
description
从扫描件、图像和扫描版PDF中提取文本和结构。用于OCR、可搜索PDF、表格提取、收据解析和名片解析。
OCR文档处理器
处理OCR密集型输入,需要从图像或扫描页面中恢复文本。
适用场景
- 对图像和扫描版PDF进行OCR
- 导出可搜索PDF
- 结构化提取为文本、Markdown、JSON或HTML
- 从扫描材料中提取表格
- 收据解析和名片解析
工作流程
- 判断是否需要纯OCR、结构化提取或特定文档解析。
- 在提取前对存在倾斜、模糊或阴影的噪声输入进行预处理。
- 使用
scripts/ocr_processor.py处理核心OCR任务。 - 当输入为专用类型时,使用专用辅助脚本:
scripts/business_card_scanner.pyscripts/receipt_scanner.py
- 当来源质量低、旋转、手写或多语言时,返回置信度提示。
安全护栏
- 当准确性重要时,优先明确指定语言。
- 当OCR置信度较低时,不要声称字段完全准确。
- 默认将非扫描的数字PDF路由到
document-converter-suite而非OCR。






