专栏:大模型应用开发:从原理到生产
篇号:20
建议权限:付费
建议标签:Embedding、向量检索、RAG、语义搜索、AI应用开发

上一篇我们讲了文档解析与分块。
一句话总结:
RAG 的地基,是一块一块干净、完整、可追溯的知识块。
但知识块准备好以后,还有一个问题:
系统怎么知道用户的问题和哪个知识块相关?
最朴素的办法是关键词搜索。
用户问“审计日志”,系统就找包含“审计日志”的文本块。
这个办法有用,但不够。
因为用户不会永远使用和文档一样的词。
用户可能问:
企业版能不能查看成员操作记录?
而文档里写的是:
企业版支持审计日志,管理员可以查看成员登录、权限变更、数据导出等操作记录。
这两段文本里,用户没有直接说“审计日志”。
但人一看就知道,它们在讲同一件事。
问题是,计算机怎么知道?
这就是 Embedding 和向量检索要解决的问题。
订阅专栏 解锁全文
5156

被折叠的 条评论
为什么被折叠?



