rag-architect

rag-architect

热门

设计并实现生产级RAG系统,包括文档分块、生成嵌入向量、配置向量存储、构建混合搜索管道、应用重排序以及评估检索质量。在构建RAG系统、向量数据库或需要语义搜索、文档检索、上下文增强、相似性搜索或基于嵌入索引的知识驱动AI应用时使用。

1.1万Star
972Fork
更新于 2026/5/20
SKILL.md
readonly只读
name
rag-architect
description

设计并实现生产级RAG系统,包括文档分块、生成嵌入向量、配置向量存储、构建混合搜索管道、应用重排序以及评估检索质量。在构建RAG系统、向量数据库或需要语义搜索、文档检索、上下文增强、相似性搜索或基于嵌入索引的知识驱动AI应用时使用。

RAG架构师

核心工作流

  1. 需求分析 — 确定检索需求、延迟约束、准确性要求和规模
  2. 向量存储设计 — 选择数据库、模式设计、索引策略、分片方法
  3. 分块策略 — 文档分割、重叠、语义边界、元数据丰富
  4. 检索管道 — 嵌入选择、查询转换、混合搜索、重排序
  5. 评估与迭代 — 指标跟踪、检索调试、持续优化

每一步完成后需验证(参见下面的检查点)。

参考指南

根据上下文加载详细指导:

主题 参考 加载时机
向量数据库 references/vector-databases.md 比较Pinecone、Weaviate、Chroma、pgvector、Qdrant时
嵌入模型 references/embedding-models.md 选择嵌入、微调、维度权衡时
分块策略 references/chunking-strategies.md 文档分割、重叠、语义分块时
检索优化 references/retrieval-optimization.md 混合搜索、重排序、查询扩展、过滤时
RAG评估 references/rag-evaluation.md 指标、评估框架、检索调试时

实现示例

1. 文档分块

from langchain.text_splitter import RecursiveCharacterTextSplitter

# 根据领域数据评估chunk_size——切勿盲目使用512
splitter = RecursiveCharacterTextSplitter(
    chunk_size=800,
    chunk_overlap=100,
    separators=["\n\n", "\n", ". ", " "],
)

chunks = splitter.create_documents(
    texts=[doc.page_content for doc in raw_docs],
    metadatas=[{"source": doc.metadata["source"], "timestamp": doc.metadata.get("timestamp")} for doc in raw_docs],
)

检查点: assert all(c.metadata.get("source") for c in chunks), "Missing source metadata"

2. 生成嵌入向量与索引

from openai import OpenAI
import qdrant_client
from qdrant_client.models import VectorParams, Distance, PointStruct

client = OpenAI()
qdrant = qdrant_client.QdrantClient("localhost", port=6333)

# 创建集合
qdrant.recreate_collection(
    collection_name="knowledge_base",
    vectors_config=VectorParams(size=1536, distance=Distance.COSINE),
)

def embed_chunks(chunks: list[str], model: str = "text-embedding-3-small") -> list[list[float]]:
    response = client.embeddings.create(input=chunks, model=model)
    return [r.embedding for r in response.data]

# 通过确定性ID实现幂等upsert与去重
import hashlib, uuid

points = []
for i, chunk in enumerate(chunks):
    doc_id = str(uuid.UUID(hashlib.md5(chunk.page_content.encode()).hexdigest()))
    embedding = embed_chunks([chunk.page_content])[0]
    points.append(PointStruct(id=doc_id, vector=embedding, payload=chunk.metadata))

qdrant.upsert(collection_name="knowledge_base", points=points)

检查点: assert qdrant.count("knowledge_base").count == len(set(p.id for p in points)), "Deduplication failed"

3. 混合搜索(向量 + BM25)

from qdrant_client.models import Filter, FieldCondition, MatchValue, SparseVector
from rank_bm25 import BM25Okapi

def hybrid_search(query: str, tenant_id: str, top_k: int = 20) -> list:
    # 稠密检索
    query_embedding = embed_chunks([query])[0]
    tenant_filter = Filter(must=[FieldCondition(key="tenant_id", match=MatchValue(value=tenant_id))])
    dense_results = qdrant.search(
        collection_name="knowledge_base",
        query_vector=query_embedding,
        query_filter=tenant_filter,
        limit=top_k,
    )

    # 稀疏检索(BM25)
    corpus = [r.payload.get("text", "") for r in dense_results]
    bm25 = BM25Okapi([doc.split() for doc in corpus])
    bm25_scores = bm25.get_scores(query.split())

    # 倒数排名融合
    ranked = sorted(
        zip(dense_results, bm25_scores),
        key=lambda x: 0.6 * x[0].score + 0.4 * x[1],
        reverse=True,
    )
    return [r for r, _ in ranked[:top_k]]

检查点: assert len(hybrid_search("test query", tenant_id="demo")) > 0, "Hybrid search returned no results"

4. 重排序Top-K结果

import cohere

co = cohere.Client("YOUR_API_KEY")

def rerank(query: str, results: list, top_n: int = 5) -> list:
    docs = [r.payload.get("text", "") for r in results]
    reranked = co.rerank(query=query, documents=docs, top_n=top_n, model="rerank-english-v3.0")
    return [results[r.index] for r in reranked.results]

5. 检索评估

# 对标注的评估集运行precision@k和recall@k
# python evaluate.py --metrics precision@10 recall@10 mrr --collection knowledge_base

from ragas import evaluate
from ragas.metrics import context_precision, context_recall, faithfulness, answer_relevancy
from datasets import Dataset

eval_dataset = Dataset.from_dict({
    "question": questions,
    "contexts": retrieved_contexts,
    "answer": generated_answers,
    "ground_truth": ground_truth_answers,
})

results = evaluate(eval_dataset, metrics=[context_precision, context_recall, faithfulness, answer_relevancy])
print(results)

检查点: 在进入LLM集成之前,目标为 context_precision >= 0.7context_recall >= 0.6

约束

必须做

  • 在确定嵌入模型之前,在领域数据上评估多个嵌入模型
  • 为生产系统实现混合搜索(向量+关键词)
  • 添加元数据过滤以支持多租户或特定领域检索
  • 衡量检索指标(precision@k, recall@k, MRR, NDCG)
  • 在将上下文传递给LLM之前,对top-k结果使用重排序
  • 实现具有去重功能的幂等摄取(确定性ID)
  • 持续监控检索延迟和质量
  • 对嵌入进行版本管理,并规划模型迁移

禁止做

  • 未在领域数据上评估就使用默认分块大小(512)
  • 跳过元数据丰富(来源、时间戳、章节)
  • 只关注LLM输出质量而忽略检索质量指标
  • 存储未经预处理/清洗的原始文档
  • 仅使用余弦相似度处理复杂的多领域检索
  • 未在生产级数据量上测试就部署
  • 忘记处理边缘情况(空结果、格式错误的文档)
  • 将嵌入模型与应用代码紧密耦合

输出模板

设计RAG架构时,应提供:

  1. 系统架构图(摄取+检索管道)
  2. 向量数据库选择及权衡分析
  3. 分块策略及示例和理由
  4. 检索管道设计(查询→结果流程)
  5. 评估计划,包括指标、基准和通过/失败阈值

文档