
🐇明明跟你说过:个人主页
🏅个人专栏:《深度探秘:AI界的007》 🏅
🔖行路有良友,便是天堂🔖
目录
1、使用 PDFLoader + RecursiveCharacterTextSplitter 构建文档块
一、引言
1、什么是LangChain
想象一下,你正在和 ChatGPT 聊天,问它一个复杂的问题,比如:“我上传的这份 PDF 文档里,第三章说的那个算法和第五章的原理有啥关系?”
这时候,你希望 AI 不光能看懂问题,还能读懂文档、记住上下文、把答案说清楚,对吧?😎
这,就是 LangChain 登场的地方!
🌟 简单一句话:
LangChain 是一个帮你构建 “更聪明的 AI 应用” 的框架。
🧩 它能做什么?
LangChain 像一个多才多艺的管家,替你打理 AI 应用的多个方面:
| 能力 | 举个栗子 🌰 |
|---|---|
| 📄 文档读取 | 支持 PDF、Word、网页、Notion 等多种格式! |
| ✂️ 文本切分 | 把长文章变成模型“能吃得下”的小块块 |
| 📦 存储与检索 | 把文档变成向量存在“记忆库”里,方便快速查找 |
| 🧠 调用大模型 | 接入 OpenAI、Claude、Ollama 等模型对话 |
| 🪜 工作流链条 | 把多个步骤串成“智能流程”,比如 读取→提问→总结 |
🤔 举个真实的例子:
你想构建一个 智能客服机器人,它能自动读取你的公司文档、PDF 手册、产品说明书,并且回答用户的问题。
你只要这样做:
-
✅ 用 LangChain 的 Document Loader 读取资料
-
✂️ 用 Text Splitter 把文档切成合适的大小
-
📦 存到向量数据库中,比如 FAISS 或 Elasticsearch
-
🤖 用户提问 → LangChain 帮你搜索相关文档片段
-
💬 调用大模型回答问题,还能引用来源!
是不是有点小惊艳?✨
🛠️ 为什么开发者喜欢它?
-
模块化:想换个模型、数据库?一行代码改完!
-
灵活性:适合快速搭建原型,也能打造企业级系统
-
社区活跃:文档全、插件多,成长飞快!
🏁 总结
LangChain = LLM 的超级助理工具箱🧰 + AI 应用的魔法管家🪄
如果你想让 AI 不止聊天,还能 读文档、处理流程、接数据源、当助手——LangChain 会是你的好搭档!

2、LangChain 在智能应用中的作用
在过去,我们想让 AI 做事,大多是“一个模型回答一个问题”——比如问 ChatGPT:“天气怎么样?”它会给你一个答案。
但当我们想让 AI 真正“工作起来”,比如:
-
📄 阅读上百页的 PDF 文档
-
📚 理解多个文件之间的关系
-
🧠 记住用户的历史提问
-
⚙️ 调用外部工具,比如数据库、搜索引擎、API
-
🔁 串联多个步骤,像人一样完成一项任务
👉 光靠一个大模型可不够了!这时,就轮到 LangChain 登场了!
🧰 LangChain 的作用是什么?
可以简单理解为:
LangChain 是连接大模型(LLM)与真实世界的桥梁🌉,让你的 AI 应用更聪明、更有用、更像“工具人”。
✅ 它解决了哪些问题?
| 智能应用需求 | LangChain 帮你搞定 ✔️ |
|---|---|
| 加载和处理各种格式文档 | 使用 Document Loaders |
| 将大文本拆分为小块供模型处理 | 使用 Text Splitters |
| 存储、检索知识片段 | 集成向量数据库(如 FAISS、Chroma 等) |
| 结合上下文做连续对话 | 支持 Memory 模块 |
| 自动调用外部工具 / API | Agent + Tool 模块 |
| 多步骤任务处理流程 | 使用 Chain(链式执行)机制 |
🧠 举个例子:
你要做一个 “AI 法律助手”,目标是能:
-
📂 读取几十份法律文书
-
🤔 回答用户关于具体条款的问题
-
💡 根据上下文推荐可能适用的法规
-
📬 自动生成答复邮件或草案
用 LangChain 的做法大致是这样:
-
用 Document Loaders 加载文书内容 📄
-
用 Text Splitters 切分成模型能处理的小段 ✂️
-
用 Embedding + 向量数据库 存储和快速检索 🧠
-
用 LLM + Chain 回答用户提问,引用相关文档 💬
-
用 Agent + Tool 自动生成邮件并发送 📧
是不是已经能脑补出整个系统架构了?😆

二、Document Loaders 概述
1、什么是 Document Loader
在构建 AI 应用时,我们经常会遇到这样的任务:
“把一份 PDF 文档、网页、Markdown 文件、甚至 Notion 页面内容,喂给大模型,让它理解并回答问题。”
问题来了:这些内容格式五花八门,模型又只接受纯文本或结构化数据,我们该怎么办?🤔
这时,LangChain 提供的 Document Loader(文档加载器) 就派上用场啦!
Document Loader 就像一个“格式转换器”+“文件导入助手”,负责把各种各样的文档 👉 变成大模型能理解的“纯文本+元信息”结构。
📦 一个典型的加载结果长这样:
{
"page_content": "这里是文档的正文内容……",
"metadata": {


811

被折叠的 条评论
为什么被折叠?



