indexion-segment

indexion-segment

将文本分割为上下文相关的块,用于RAG/嵌入管道。通过窗口、TF-IDF、标点或混合策略(根据意图选择)进行文档分段和章节提取。

1Star
2Fork
更新于 2026/7/11
SKILL.md
readonly只读
name
indexion-segment
description

将文本分割为上下文相关的块,用于RAG/嵌入管道。通过窗口、TF-IDF、标点或混合策略(根据意图选择)进行文档分段和章节提取。

indexion segment

使用基于差异、TF-IDF或标点策略将文本分割为上下文相关的段落。

使用时机

  • 用户需要为RAG或嵌入管道对文本进行分块
  • 用户希望将文档拆分为有意义的章节
  • 用户要求对文本进行分段处理
  • 准备在子文档级别进行相似性分析的文本

用法

# 默认窗口差异策略
indexion segment <input-file> <output-dir>

# 基于TF-IDF的分段
indexion segment --strategy=tfidf <input-file> <output-dir>

# 基于标点的分段
indexion segment --strategy=punctuation <input-file> <output-dir>

# 自定义段落大小
indexion segment --min-size=200 --max-size=3000 --target-size=800 document.txt output/

# 自定义差异阈值
indexion segment --threshold=0.5 document.txt output/

# 自适应阈值模式(默认)
indexion segment --adaptive document.txt output/

# 混合NCD+TF-IDF模式
indexion segment --hybrid --ncd-weight=0.6 --tfidf-weight=0.4 document.txt output/

# 自定义窗口大小
indexion segment --window-size=5 document.txt output/

# 自定义输出前缀
indexion segment --prefix=chunk document.txt output/

选项

选项 默认值 描述
--strategy=NAME window 策略:window, tfidf, punctuation
--min-size=INT 100 最小段落字符数
--max-size=INT 2000 最大段落字符数
--target-size=INT 500 目标段落字符数
--threshold=FLOAT 0.42 差异阈值
--window-size=INT 3 窗口大小
--adaptive true 自适应阈值模式
--hybrid false NCD+TF-IDF混合模式
--ncd-weight=FLOAT 0.5 混合模式中NCD权重
--tfidf-weight=FLOAT 0.5 混合模式中TF-IDF权重
--prefix=NAME segment 输出文件前缀

策略

策略 描述
window(默认) 滑动窗口差异检测
tfidf 基于TF-IDF的主题变化检测
punctuation 基于标点/句子边界

工作流程

  1. 运行 indexion segment <input-file> <output-dir> 使用默认设置分割文本
  2. 调整 --threshold--target-size 以调整分段粒度
  3. 对混合内容文档使用 --hybrid 模式以获得更高准确性