52、无损预处理浮点数据以增强压缩效果

无损预处理浮点数据以增强压缩效果

1. 背景与基础概念

在处理单维浮点数据集时,我们的目标是通过预处理使数据集压缩后比原始数据集更小。首先,我们使用压缩比(CR)来量化压缩效果,其计算公式为:
[CR = \frac{压缩数据集的比特大小 + 压缩元数据}{未压缩数据集的比特大小}]
其中,元数据可能用于解压缩。

1.1 浮点数字压缩

最常见的浮点数字标准是 IEEE - 754,一个数字 (x) 由符号((S))、指数((E))和尾数((M))三个部分表示。在双精度(每个数字 64 位)的情况下,(x) 可表示为:
[x = (-1)^S \cdot 2^{E - B} \cdot (1 + M \cdot 2^{-l})]
其中 (B = 1023) 是指数的偏移量,(l = 52) 是尾数的位数。64 位中,1 位是符号位,11 位是指数位,其余 52 位是尾数位。

提高可压缩性的一个思路是最大化要压缩的数据集中所有数字共享的位数。当数据集中所有数字的第 (i) 位值相同时,我们称第 (i) 位是共享的。研究表明,共享位数越多,压缩效果越好,但之前的预处理技术是有损的,接下来我们将介绍无损预处理技术。

2. 关键观察

2.1 浮点数字的无损操作

由于用有限位数表示的数字精度有限,IEEE - 754 只能表示实数轴上的一部分数字,不在此范围内的值会被近似。我们用最后一位单位(ULP)来表示数字 (x) 的精度,计算公式为:
[ULP(x) = 2^{E_x - 1023 - 52}]
操作浮点数字可能导致信息损失,因为 UL

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值