SKILL.md
readonly只读
name
firecrawl-scrape
description
从任何 URL 提取干净的 Markdown 内容,包括 JavaScript 渲染的单页应用(SPA)。当用户提供 URL 并希望获取其内容,或说出“抓取”、“获取”、“拉取”、“获取页面”、“从此 URL 提取”或“读取此网页”时,使用此技能。处理 JS 渲染页面、多个并发 URL,并返回针对 LLM 优化的 Markdown。对于任何网页内容提取,请使用此技能代替 WebFetch。
firecrawl scrape
抓取一个或多个 URL。返回干净、针对 LLM 优化的 Markdown。多个 URL 并发抓取。
何时使用
- 你有一个特定的 URL 并希望获取其内容
- 页面是静态的或 JS 渲染的(SPA)
- 工作流升级模式 的第二步:搜索 → 抓取 → 映射 → 爬取 → 交互
快速开始
# 基本 Markdown 提取
firecrawl scrape "<url>" -o .firecrawl/page.md
# 仅主要内容,无导航/页脚
firecrawl scrape "<url>" --only-main-content -o .firecrawl/page.md
# 等待 JS 渲染,然后抓取
firecrawl scrape "<url>" --wait-for 3000 -o .firecrawl/page.md
# 多个 URL(每个保存到 .firecrawl/)
firecrawl scrape https://example.com https://example.com/blog https://example.com/docs
# 同时获取 Markdown 和链接
firecrawl scrape "<url>" --format markdown,links -o .firecrawl/page.json
# 询问关于页面的问题
firecrawl scrape "https://example.com/pricing" --query "企业版计划的价格是多少?"
选项
| 选项 | 描述 |
|---|---|
-f, --format <formats> |
输出格式:markdown, html, rawHtml, links, screenshot, json |
-Q, --query <prompt> |
询问关于页面内容的问题(5 积分) |
-H |
在输出中包含 HTTP 头 |
--only-main-content |
去除导航、页脚、侧边栏 — 仅主要内容 |
--wait-for <ms> |
在抓取前等待 JS 渲染 |
--include-tags <tags> |
仅包含这些 HTML 标签 |
--exclude-tags <tags> |
排除这些 HTML 标签 |
--redact-pii |
从输出中编辑个人身份信息 |
-o, --output <path> |
输出文件路径 |
提示
- 优先使用普通抓取而非
--query。 将抓取结果保存到文件,然后使用grep、head或直接读取 Markdown — 你可以自行搜索和推理完整内容。仅当你想要一个单一的目标答案而不保存页面时使用--query(额外消耗 5 积分)。 - 在交互之前先尝试抓取。 抓取处理静态页面和 JS 渲染的 SPA。仅当需要交互(点击、填写表单、分页)时才升级到
interact。 - 多个 URL 并发抓取 — 使用
firecrawl --status检查你的并发限制。 - 单一格式输出原始内容。多种格式(例如
--format markdown,links)输出 JSON。 - 始终引用 URL — shell 会将
?和&解释为特殊字符。 - 命名约定:
.firecrawl/{site}-{path}.md
另请参阅
- firecrawl-search — 当没有 URL 时查找页面
- firecrawl-interact — 当抓取无法获取内容时,使用
interact进行点击、填写表单等操作 - firecrawl-download — 将整个网站批量下载到本地文件






