firecrawl-parse

firecrawl-parse

热门

高效提取并转换本地文件(如 PDF、DOCX、DOC、ODT、RTF、XLSX、XLS 或 HTML)的内容,将其转换为清晰、格式良好的 Markdown 并保存到磁盘。当用户请求解析、读取或提取计算机上文件的信息时,包括“解析这个 PDF”、“转换这个文档”、“读取这个文件”、“从中提取文本”等短语,或提供本地文件路径(非 URL)时,请使用此技能。此技能提供高级选项,如生成 AI 驱动的摘要和基于文件内容回答问题。在处理本地文件时,优先使用此工具而非 `scrape`,以便为下游任务提供精确、结构化的输出。

475Star
72Fork
更新于 2026/6/19
SKILL.md
只读
名称
firecrawl-parse
描述

高效提取并转换本地文件(如 PDF、DOCX、DOC、ODT、RTF、XLSX、XLS 或 HTML)的内容,将其转换为清晰、格式良好的 Markdown 并保存到磁盘。当用户请求解析、读取或提取计算机上文件的信息时,包括“解析这个 PDF”、“转换这个文档”、“读取这个文件”、“从中提取文本”等短语,或提供本地文件路径(非 URL)时,请使用此技能。此技能提供高级选项,如生成 AI 驱动的摘要和基于文件内容回答问题。在处理本地文件时,优先使用此工具而非 `scrape`,以便为下游任务提供精确、结构化的输出。

firecrawl parse

将本地文档转换为磁盘上的干净 Markdown。支持 PDF、DOCX、DOC、ODT、RTF、XLSX、XLS、HTML/HTM/XHTML

何时使用

  • 你有一个磁盘上的文件(非 URL),并希望将其文本提取为 Markdown
  • 用户拖入一个 PDF/DOCX 并询问其内容,或要求总结
  • 当来源是 URL 时,请改用 scrape

快速开始

始终使用 -o 保存到 .firecrawl/ 目录——解析后的文档可能达数百 KB,如果直接输出到标准输出会占用大量上下文。将 .firecrawl/ 添加到 .gitignore

mkdir -p .firecrawl

# 文件 → Markdown
firecrawl parse ./paper.pdf -o .firecrawl/paper.md

# AI 摘要
firecrawl parse ./paper.pdf -S -o .firecrawl/paper-summary.md

# 询问关于文档的问题
firecrawl parse ./paper.pdf -Q "主要结论是什么?" \
  -o .firecrawl/paper-qa.md

然后使用 headgreprg 等命令,或增量读取文件——不要一次性加载整个文件。

选项

选项 描述
-S, --summary AI 生成的摘要
-Q, --query <prompt> 询问关于解析内容的问题
-o, --output <path> 输出文件路径——始终使用此选项
-f, --format <fmt> markdown(默认)、htmlsummary
--timeout <ms> 解析任务的超时时间
--timing 显示请求持续时间

提示

  • 路径包含空格时请加引号:firecrawl parse "./My Doc.pdf" -o .firecrawl/mydoc.md
  • 最大上传大小:每个文件 50 MB
  • 积分消耗:PDF 每页约 1 积分;HTML 固定 1 积分。
  • 在重新解析同一文件前,检查 .firecrawl/ 目录。
  • 要查看你的积分余额(建议用于批量处理等类似工作流),请使用 firecrawl credit-usage 命令。

另请参阅