SKILL.md
只读
名称
firecrawl-knowledge-base
描述
使用 Firecrawl 从网络内容构建知识库。适用于本地参考文档、RAG 就绪的文本块、微调数据集、文档镜像、主题语料库或从网络来源整理的 LLM 就绪 Markdown。
Firecrawl 知识库
使用此工具将 URL 或主题转换为组织良好的 LLM 就绪内容。
入职访谈
根据上下文推断来源、目标、深度和输出位置。如果来源和目标明确,请立即继续。
仅在遇到障碍时提出最多 1-3 个简洁问题,例如来源 URL/主题、输出是参考/RAG/训练/文档,或者如果需要训练,询问训练格式。
Firecrawl 收集计划
对于文档站点使用 Firecrawl 地图,对于基于主题的语料库使用搜索,将页面抓取为 Markdown,并保留代码示例和表格。
对于文件,遵循 Firecrawl 下载风格约定:
.firecrawl/
<hostname>/
<path>/
index.md
并行工作
如果合适,使用子代理或等效的并行任务运行器:
- 每个研究人员负责一个文档部分
- 按来源类型划分官方文档、教程、社区讨论和参考资料
- 来源抓取 vs 块生成 vs 清单生成
输出模式
- 参考:Markdown 文件、
index.md和sources.json。 - RAG:Markdown 文件加上块文件和
manifest.json。 - 训练:抓取的源文件加上
training-data.jsonl和training-metadata.json。 - 文档镜像:完整的 Markdown 镜像,带有目录。
最终交付物
# 知识库:[来源]
## 摘要
[收集了什么以及为什么]
## 输出结构
[创建的文件/目录]
## 覆盖范围
[章节、来源类型、数量]
## 使用说明
[如何在 RAG、文档、训练或代理上下文中使用]
## 来源
[收集的 URL]
## 重新运行输入
workflow: firecrawl-knowledge-base
source: [url/topic]
goal: [reference/rag/train/docs]
depth: [quick/thorough/exhaustive]
output_dir: [.firecrawl/]
质量标准
- 保留代码示例和格式。
- 尽可能移除样板导航。
- 在 frontmatter 或元数据中包含来源 URL。






