跳到正文
技术吧

文本分块

按长度或分隔符切分文本,便于准备 RAG / LLM 输入。

文本分块(Text Chunking)把长文档切成适合嵌入与检索的片段。合适的分块大小与重叠能提升 RAG 召回质量,减少答案跑偏。

打开工具

能做什么

怎么用

  1. 粘贴或输入待切分的长文本
  2. 调整分块长度、重叠或分隔规则
  3. 预览分块结果,确认语义边界是否合理
  4. 将合适参数应用到你的 RAG 流水线

常见问题

为什么 RAG 需要文本分块?

向量检索通常对短片段效果更好。过大的块会稀释语义,过小的块会丢失上下文;分块是在召回精度与上下文完整性之间做权衡。

分块大小一般选多少?

常见起点是 200–800 tokens(或约 500–2000 字符),再按文档类型与模型上下文窗口微调,并用检索评测验证。

相关文章

← 实用工具