firecrawl-knowledge-ingest

firecrawl-knowledge-ingest

使用 Firecrawl 浏览器摄取公共或经过身份验证的知识库和文档门户。适用于 JS 密集型文档、需要登录的门户、分页帮助中心、支持知识库或从文档站点提取结构化 JSON/Markdown。

53Star
12Fork
更新于 2026/6/25
SKILL.md
只读
名称
firecrawl-knowledge-ingest
描述

使用 Firecrawl 浏览器摄取公共或经过身份验证的知识库和文档门户。适用于 JS 密集型文档、需要登录的门户、分页帮助中心、支持知识库或从文档站点提取结构化 JSON/Markdown。

Firecrawl 知识摄取

当文档门户需要浏览器导航、身份验证、分页或 JS 渲染时使用此功能。

入职访谈

根据上下文推断门户 URL、输出格式、身份验证需求和页面限制。如果门户明确,则立即进行。

仅在遇到阻碍时提出最多 1-3 个简洁问题,例如门户 URL、是否需要身份验证或所需的输出格式。

Firecrawl 采集计划

使用 Firecrawl 浏览器:

  • 打开门户并检查导航
  • 识别章节、类别、侧边栏链接和文章 URL
  • 跟随侧边栏导航、下一页链接、分页、加载更多控件或搜索
  • 将文章内容抓取为 Markdown
  • 提取元数据,如标题、章节、最后更新日期、作者和标签

尝试使用 Firecrawl 地图作为公共 URL 的补充,但对于需要身份验证或 JS 密集型内容,请使用浏览器导航。

最终交付物

# 知识摄取:[门户]

## 摘要
[提取的页面、覆盖的章节、限制]

## 输出
[JSON/Markdown/合并文件路径或内容]

## 章节
[章节名称和文章数量]

## 失败或受限页面
[任何访问/加载问题]

## 来源
[提取的 URL]

## 重新运行输入
workflow: firecrawl-knowledge-ingest
url: [门户 URL]
format: [json/markdown/merged]
max_pages: [数字]

JSON 结构

使用 sourceurlextractedAttotalArticlessections[],其中包含文章的 titleurlsectioncontentmetadata

质量标准

  • 保留代码示例、表格和格式。
  • 去除导航框架、页眉和页脚。
  • 跟踪提取进度和页面失败。
  • 尊重身份验证边界。