也许你听说过“如何下压过滤条件到混合搜索中” 这样的技术讨论,它的需求来源是什么呢?
举个例子,Glean 是一个企业 AI 搜索软件,它能够非常高质量地针对用户自然查询语言搜出符合要求的文档,并且,这些文档都是用户有权限访问的文档。没有权限的文档,一个也看不到。
怎么做到的呢?
企业里会构建出一个唯一的文档向量索引。自然语言搜索会用到向量索引,企业会基于所有文档构建出一个统一的向量索引出来,对于用户小余来说,它实际有权限访问的,只是里面很少的一部分。
企业里有一个文档权限表,里面详细记录了小余有权限访问的文档 ID。
查询期间,我们可以带上访问权限 ID 列表,或者带上基于这个列表生成的位图,去搜索向量索引。通过这个位图,我们可以极大地降低向量计算量,跳过不必要的计算。

总结:最大的下压需求来源是权限控制。


1133

被折叠的 条评论
为什么被折叠?



