混乱是如何开始
设想一个企业决策会议:首席财务官要求人工智能系统提供按客户群体分类的收入数据。
系统返回了三个不同的数字,因为对于"客户“这个概念,CRM将其称为“账户”,ERP系统将其称为“客户”,而WMS系统则将其标记为”具体的客户名称“。这三个标签虽然不同,但它们代表的是同一个概念。然而,AI无法清晰地区分它们。
这不是RAG检索失败。向量检索正确,嵌入也匹配。
问题出在上游:人工智能根本不知道这三个标签指的是同一个现实世界的事物。
这就是语义问题,也是大多数人工智能部署性能不佳的根本原因。
技术栈的每一层——模型、代理、编排——其可靠性都取决于其下方语义层的可靠性。
如果对数据实际代表的含义缺乏共享且统一的理解,那么你构建的就不是智能,而是大规模地制造混乱。
意义是与生俱来的
在谷歌进入这个领域之前,所有竞争对手都认同一个核心原则:意义应该由组织内部有意识地创造。
Palantir 指派专业工程师手动开发数字孪生模型。
微软的 Fabric IQ 在你现有的基础架构上建立本体契约。
而谷歌则提出了一种结构上截然不同的方案:意义是一种与生俱来的东西。
谷歌与其他企业语义层的主要区别在于,它并非通过聘用特定领域的架构师来创造意义,而是通过一个能够自动捕捉意义运作方式的学习模型。
语义层应六大考量因素
Google认为成功实现语义层需要考虑六个关键因素:
- 1.联结数据团队与业务团队:能促使精通业务逻辑的领域专家与深谙数据分析底层数据的数据专家协同合作。多年来,如何大规模地促成这两类专家之间的合作;
- 2.支持多个数据源:能够跨越多个数据源,这样,当用户提出问题时,不论结构化数据存于何处,LLM 都能给出适当的回答;
- 3.轻松与更广泛的 AI 平台策略集成:能够利用语义建模数据及非语义建模数据来解决问题并执行操作。例如:能否通过模型上下文协议服务器公开其查询功能?智能体能否轻松访问语义层的 API?
- 4.成为企业工作流的一部分:确保语义层的范围不局限于孤立存在的对话式体验, 并且分析洞见也不局限于对话本身;
- 5.适合企业级应用:支持 VPC 服务控制等功能以进行边界防御;支持客户管理的加密密钥以增强对敏感数据的控制;支持专用 IP 连接以隔离流量,还要能够确保数据安全与合规。
- 6.驻留以满足监管要求:确保针对语义层编写的所有 SQL 均为标准的非专有 SQL,避免将逻辑嵌入特定工作簿。
谷歌的语义层架构
谷歌并非要求企业在构建自己的语义层和购买他人的语义层之间做出选择。它提出的方案是:
以数据创建的速度,持续不断地从数据本身自动提取意义。
Google语义层架构由三个相互协调的层组成。
- 智能存储层: 整合多模态数据,数据(如PDF或图像)进入Google Cloud Storage后,自动完成实体解析和实体标记,直接变成运行时可用的资产;
- 知识引擎层: 吸收源头元数据与LookML 语义, 借助 Gemini 深度理解多模态数据并自动构建术语体系,提供亚秒级、带权限校验的混合检索;
- 企业级AI代理层: 基于企业特定的语义以及谷歌十多年来开发的关系模型构建企业上下文。

390

被折叠的 条评论
为什么被折叠?



