【信息科学与工程学】【数据科学】第八十九篇 高维数据/高维向量处理01

高维数据/高维向量处理是一个庞大的方法体系,学界通常把它拆成两条主线:降维(Dimensionality Reduction)​ 和 向量检索(ANN Search),再辅以特征选择、正则化、专用模型等手段。"高纬度"我按"高维(high-dimensional)"理解,下面把主流与常见方法按表格方式汇总。

💡 现代 embedding 模型动辄产出 768~4096 维向量,暴力 k-NN 在百万级以上基本不可用——这是所有下面这些方法存在的根本原因。


一、降维方法(Dimensionality Reduction)

把高维向量压缩到低维空间,同时尽量保留关键信息。山东大学学报的综述将其分为线性降维与非线性降维两大类。

1. 线性降维

方法

核心思想

优点

缺点

典型场景

PCA(主成分分析)

对协方差矩阵做特征值分解,投影到最大方差的正交方向

简单、确定性、可解释性好、计算高效

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值