高维数据/高维向量处理是一个庞大的方法体系,学界通常把它拆成两条主线:降维(Dimensionality Reduction) 和 向量检索(ANN Search),再辅以特征选择、正则化、专用模型等手段。"高纬度"我按"高维(high-dimensional)"理解,下面把主流与常见方法按表格方式汇总。
💡 现代 embedding 模型动辄产出 768~4096 维向量,暴力 k-NN 在百万级以上基本不可用——这是所有下面这些方法存在的根本原因。
一、降维方法(Dimensionality Reduction)
把高维向量压缩到低维空间,同时尽量保留关键信息。山东大学学报的综述将其分为线性降维与非线性降维两大类。
1. 线性降维
| 方法 |
核心思想 |
优点 |
缺点 |
典型场景 |
|---|---|---|---|---|
| PCA(主成分分析) |
对协方差矩阵做特征值分解,投影到最大方差的正交方向 |
简单、确定性、可解释性好、计算高效 |
订阅专栏 解锁全文

180

被折叠的 条评论
为什么被折叠?



