SKILL.md
readonly只读
name
indexion-segment
description
将文本分割为上下文相关的块,用于RAG/嵌入管道。通过窗口、TF-IDF、标点或混合策略(根据意图选择)进行文档分段和章节提取。
indexion segment
使用基于差异、TF-IDF或标点策略将文本分割为上下文相关的段落。
使用时机
- 用户需要为RAG或嵌入管道对文本进行分块
- 用户希望将文档拆分为有意义的章节
- 用户要求对文本进行分段处理
- 准备在子文档级别进行相似性分析的文本
用法
# 默认窗口差异策略
indexion segment <input-file> <output-dir>
# 基于TF-IDF的分段
indexion segment --strategy=tfidf <input-file> <output-dir>
# 基于标点的分段
indexion segment --strategy=punctuation <input-file> <output-dir>
# 自定义段落大小
indexion segment --min-size=200 --max-size=3000 --target-size=800 document.txt output/
# 自定义差异阈值
indexion segment --threshold=0.5 document.txt output/
# 自适应阈值模式(默认)
indexion segment --adaptive document.txt output/
# 混合NCD+TF-IDF模式
indexion segment --hybrid --ncd-weight=0.6 --tfidf-weight=0.4 document.txt output/
# 自定义窗口大小
indexion segment --window-size=5 document.txt output/
# 自定义输出前缀
indexion segment --prefix=chunk document.txt output/
选项
| 选项 | 默认值 | 描述 |
|---|---|---|
--strategy=NAME |
window | 策略:window, tfidf, punctuation |
--min-size=INT |
100 | 最小段落字符数 |
--max-size=INT |
2000 | 最大段落字符数 |
--target-size=INT |
500 | 目标段落字符数 |
--threshold=FLOAT |
0.42 | 差异阈值 |
--window-size=INT |
3 | 窗口大小 |
--adaptive |
true | 自适应阈值模式 |
--hybrid |
false | NCD+TF-IDF混合模式 |
--ncd-weight=FLOAT |
0.5 | 混合模式中NCD权重 |
--tfidf-weight=FLOAT |
0.5 | 混合模式中TF-IDF权重 |
--prefix=NAME |
segment | 输出文件前缀 |
策略
| 策略 | 描述 |
|---|---|
window(默认) |
滑动窗口差异检测 |
tfidf |
基于TF-IDF的主题变化检测 |
punctuation |
基于标点/句子边界 |
工作流程
- 运行
indexion segment <input-file> <output-dir>使用默认设置分割文本 - 调整
--threshold和--target-size以调整分段粒度 - 对混合内容文档使用
--hybrid模式以获得更高准确性






