SKILL.md
只读
名称
firecrawl-knowledge-ingest
描述
使用 Firecrawl 浏览器摄取公共或经过身份验证的知识库和文档门户。适用于 JS 密集型文档、需要登录的门户、分页帮助中心、支持知识库或从文档站点提取结构化 JSON/Markdown。
Firecrawl 知识摄取
当文档门户需要浏览器导航、身份验证、分页或 JS 渲染时使用此功能。
入职访谈
根据上下文推断门户 URL、输出格式、身份验证需求和页面限制。如果门户明确,则立即进行。
仅在遇到阻碍时提出最多 1-3 个简洁问题,例如门户 URL、是否需要身份验证或所需的输出格式。
Firecrawl 采集计划
使用 Firecrawl 浏览器:
- 打开门户并检查导航
- 识别章节、类别、侧边栏链接和文章 URL
- 跟随侧边栏导航、下一页链接、分页、加载更多控件或搜索
- 将文章内容抓取为 Markdown
- 提取元数据,如标题、章节、最后更新日期、作者和标签
尝试使用 Firecrawl 地图作为公共 URL 的补充,但对于需要身份验证或 JS 密集型内容,请使用浏览器导航。
最终交付物
# 知识摄取:[门户]
## 摘要
[提取的页面、覆盖的章节、限制]
## 输出
[JSON/Markdown/合并文件路径或内容]
## 章节
[章节名称和文章数量]
## 失败或受限页面
[任何访问/加载问题]
## 来源
[提取的 URL]
## 重新运行输入
workflow: firecrawl-knowledge-ingest
url: [门户 URL]
format: [json/markdown/merged]
max_pages: [数字]
JSON 结构
使用 source、url、extractedAt、totalArticles 和 sections[],其中包含文章的 title、url、section、content 和 metadata。
质量标准
- 保留代码示例、表格和格式。
- 去除导航框架、页眉和页脚。
- 跟踪提取进度和页面失败。
- 尊重身份验证边界。






