firecrawl-knowledge-base

firecrawl-knowledge-base

使用 Firecrawl 从网络内容构建知识库。适用于本地参考文档、RAG 就绪的文本块、微调数据集、文档镜像、主题语料库或从网络来源整理的 LLM 就绪 Markdown。

53Star
12Fork
更新于 2026/6/25
SKILL.md
只读
名称
firecrawl-knowledge-base
描述

使用 Firecrawl 从网络内容构建知识库。适用于本地参考文档、RAG 就绪的文本块、微调数据集、文档镜像、主题语料库或从网络来源整理的 LLM 就绪 Markdown。

Firecrawl 知识库

使用此工具将 URL 或主题转换为组织良好的 LLM 就绪内容。

入职访谈

根据上下文推断来源、目标、深度和输出位置。如果来源和目标明确,请立即继续。

仅在遇到障碍时提出最多 1-3 个简洁问题,例如来源 URL/主题、输出是参考/RAG/训练/文档,或者如果需要训练,询问训练格式。

Firecrawl 收集计划

对于文档站点使用 Firecrawl 地图,对于基于主题的语料库使用搜索,将页面抓取为 Markdown,并保留代码示例和表格。

对于文件,遵循 Firecrawl 下载风格约定:

.firecrawl/
  <hostname>/
    <path>/
      index.md

并行工作

如果合适,使用子代理或等效的并行任务运行器:

  • 每个研究人员负责一个文档部分
  • 按来源类型划分官方文档、教程、社区讨论和参考资料
  • 来源抓取 vs 块生成 vs 清单生成

输出模式

  • 参考:Markdown 文件、index.mdsources.json
  • RAG:Markdown 文件加上块文件和 manifest.json
  • 训练:抓取的源文件加上 training-data.jsonltraining-metadata.json
  • 文档镜像:完整的 Markdown 镜像,带有目录。

最终交付物

# 知识库:[来源]

## 摘要
[收集了什么以及为什么]

## 输出结构
[创建的文件/目录]

## 覆盖范围
[章节、来源类型、数量]

## 使用说明
[如何在 RAG、文档、训练或代理上下文中使用]

## 来源
[收集的 URL]

## 重新运行输入
workflow: firecrawl-knowledge-base
source: [url/topic]
goal: [reference/rag/train/docs]
depth: [quick/thorough/exhaustive]
output_dir: [.firecrawl/]

质量标准

  • 保留代码示例和格式。
  • 尽可能移除样板导航。
  • 在 frontmatter 或元数据中包含来源 URL。