前言:为什么需要知识库切片?
大型语言模型(如 GPT 系列)虽然在训练过程中学习了海量的知识,但它们存在一些固有的局限性:
- 知识截止日期:模型的知识停留在其训练数据截止的那个时间点。
- 幻觉问题:模型有时会“编造”看似合理但不正确的信息。
- 领域局限性:对于非常专业或私有的领域知识,通用大模型可能了解不足。
- 上下文长度限制:大多数 LLM 都有输入 token 数量的限制,无法一次性处理超长文档。
- 成本和效率:将所有可能用到的知识都让 LLM 在每次查询时处理一遍,既不经济也不高效。
为了解决这些问题,尤其是让 LLM 能够利用最新的、特定的或私有的知识,检索增强生成(Retrieval Augmented Generation, RAG) 框架应运而生。RAG 的核心思想是:当用户提出问题时,首先从一个外部知识库中检索与问题最相关的知识片段,然后将这些片段与原始问题一起作为上下文提供给 LLM,让 LLM 基于这些信息来生成答案。
而“知识库切片”(Knowledge Base Chunking 或 Splitting)正是 RAG 流程中至关重要的第一步(或者说数据准备阶段的关键一步)。它的目的是将原始的、可能非常庞大的文档资料(如 PDF、Word 文档、网页、代码库、数据库记录等)分解成更小、更易于管理和检索的单元,我们称之为“块”(Chunks)或“片段”(


订阅专栏 解锁全文

1284

被折叠的 条评论
为什么被折叠?



