25、自然语言水印技术解析

自然语言水印技术解析

1. 文本选择与基础概念

为了将转换形式与解析器输出相匹配,我们选择了一份政府文档作为样本语料库,具体是“核武器事故响应程序”手册( 链接 ),该文本长度为 5980 个单词,具有典型的句法结构分布,基于句法树的系统便是在这份文本上实现的。

在介绍自然语言水印方案之前,我们需要了解一些基础概念。设待加水印的文本由 n 个句子 (s_1, \cdots, s_n) 组成,每个句子 (s_i) 对应一个树 (T_i),在当前原型实现中,(T_i) 从句法上表示 (s_i),未来实现可能从语义上表示。对于每个树 (T_i),可按以下步骤得到一个二进制字符串 (B_i)(其中 (H) 是哈希函数,且忽略 (T_i) 节点的标签):
1. 按照树的前序遍历为 (T_i) 的节点编号(根节点编号为 1,根节点最左边的子节点编号为 2,依此类推)。
2. 将节点上的每个编号 (i) 替换为一个比特:若 (i + H(p)) 是模 (p) 的二次剩余,则为 1,否则为 0。这里的 (p) 是用于插入和读取水印的大素数密钥。
3. (B_i) 是按照树的后序遍历列出 (T_i) 节点上得到的比特(根节点的比特在 (B_i) 的末尾,最左边叶子节点的比特在 (B_i) 的开头,依此类推)。

需要注意的是,在后续原型中,可能会在步骤 2 的计算中考虑每个树节点的标签,当前原型未做此处理。另外,(B_i) 还有其他可能的定义方式,后续会分析上述定义的优势。

设 (\hat{B}_i = H(B

「LLM那些事」系列第 4 篇《上下文窗口的边界》,文章连接:https://blog.csdn.net/houwenjin/article/details/163999753。 演示什么:在「预测」Sheet 的黄色格子里输入一句话(默认「来泡一杯」),四个「模型」——分别只统计最后 1 / 2 / 3 / 4 个字的 n-gram 查表——同时预测下一个字。同一个输入,看的上下文越长,候选越少、预测越确定: ┌────────────────┬──────────┬───────────────┬──────┐ │ 只看最后几个字 │ 用的前缀 │ 候选下一字数 │ 预测 │ ├────────────────┼──────────┼───────────────┼──────┤ │ 1 个 │ 杯 │ 3(茶/子/水) │ 模糊 │ ├────────────────┼──────────┼───────────────┼──────┤ │ 2 个 │ 一杯 │ 2(茶/水) │ 收窄 │ ├────────────────┼──────────┼───────────────┼──────┤ │ 3 个 │ 泡一杯 │ 1(茶) │ 确定 │ ├────────────────┼──────────┼───────────────┼──────┤ │ 4 个 │ 来泡一杯 │ 1(茶) │ 确定 │ └────────────────┴──────────┴───────────────┴──────┘
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值