10个Shapiq入门示例:从表格数据到图像识别的可解释性分析

10个Shapiq入门示例:从表格数据到图像识别的可解释性分析

【免费下载链接】shapiq Shapley Interactions and Shapley Values for Machine Learning 【免费下载链接】shapiq 项目地址: https://gitcode.com/gh_mirrors/sh/shapiq

Shapiq是一个强大的机器学习可解释性工具,专注于提供Shapley交互值和Shapley值计算。无论是处理表格数据、构建树模型,还是进行图像识别,Shapiq都能帮助你深入理解模型决策过程,揭示特征之间的复杂关系。本文将通过10个实用示例,带你快速掌握Shapiq的核心功能和应用方法。

1. 安装与环境配置

开始使用Shapiq前,需要先进行安装。最简单的方法是通过pip安装:

pip install shapiq

如果你需要从源代码构建,可以克隆仓库并进行本地安装:

git clone https://gitcode.com/gh_mirrors/sh/shapiq
cd shapiq
pip install .

Shapiq的核心功能模块位于src/shapiq/目录下,包含了各种解释器、近似算法和可视化工具。

2. 表格数据基础解释:房价预测分析

表格数据是机器学习中最常见的数据类型,Shapiq提供了丰富的工具来解释这类数据上训练的模型。以加州房价预测为例,我们可以使用Shapiq分析各个特征对房价的影响。

Shapley值解释房价预测

上图展示了使用Shapley值解释房价预测的结果。从图中可以看出,房屋年龄(House)和平均房间数(AveRo)对房价有显著的正向影响,而经度(Longi)则有负向影响。这个示例展示了Shapiq如何帮助我们理解单个特征对模型预测的贡献。

相关代码示例可以在examples/tabular/目录下找到,特别是plot_shapiq_scikit_learn.py文件,详细演示了如何使用Shapiq解释scikit-learn模型。

3. 特征交互分析:位置因素对房价的影响

除了单个特征的影响,Shapiq还能揭示特征之间的交互作用。在房价预测中,纬度和经度的交互作用对房价有显著影响。

Shapley交互值分析

上图展示了Shapley交互值的分析结果,其中纬度(Latit)和经度(Longi)的交互项(Latit. x Longi.)对房价有明显的正向影响。这表明,房屋的位置(经纬度组合)比单独的纬度或经度更能决定房价。

要进行特征交互分析,可以在创建解释器时设置max_order=2,如下所示:

from shapiq import Explainer
explainer = Explainer(model, data=X, max_order=2)
interaction_values = explainer.explain(X[0], budget=1024)

4. 树模型解释:LightGBM模型的特征重要性

树模型(如LightGBM、XGBoost)在机器学习竞赛中表现优异,但它们的决策过程往往难以解释。Shapiq提供了专门的树模型解释器,能够高效地计算树模型的Shapley值和交互值。

Shapiq包结构概览

如上图所示,Shapiq的Tree Explainer模块专门用于解释树模型。你可以使用以下代码初始化树模型解释器:

from shapiq import TreeExplainer
explainer = TreeExplainer(model)
shap_values = explainer.shap_values(X)

相关示例可以在examples/trees/目录下找到,特别是plot_treeshapiq_lightgbm.py文件。

5. 图像识别解释:狐狸图像分类

Shapiq不仅适用于表格数据,还能解释计算机视觉模型的决策过程。以图像分类为例,Shapiq可以识别出对分类结果贡献最大的图像区域。

狐狸图像分类解释

上图展示了Shapiq对"红狐"图像分类的解释。图中红色节点表示对分类有正向贡献的图像区域,蓝色节点表示负向贡献。可以看到,狐狸的眼睛、耳朵和面部区域对"红狐"分类有显著的正向影响。

相关代码示例可以在examples/vision/目录下找到,特别是plot_vision_transformer.py文件。

6. 文本情感分析:电影评论情感预测

自然语言处理模型的决策过程同样可以用Shapiq来解释。以情感分析为例,Shapiq可以识别出对情感预测贡献最大的词语或短语。

虽然没有直接的图片展示文本解释结果,但你可以使用以下代码来解释文本分类模型:

from shapiq import TextExplainer
explainer = TextExplainer(model)
explanation = explainer.explain("This movie is amazing!")

相关示例可以在examples/language/目录下找到,特别是plot_sentiment_analysis.py文件。

7. 数据估值:特征重要性评估

在机器学习中,了解哪些特征对模型性能最重要是很有价值的。Shapiq可以通过计算特征的Shapley值来评估特征的重要性,帮助我们进行特征选择。

特征交互热力图

上图展示了一个特征交互热力图,显示了不同特征组合的交互值大小。这有助于我们识别出对模型预测最重要的特征组合。

要进行数据估值,可以使用以下代码:

from shapiq import Explainer
explainer = Explainer(model, class_index=y_explain_pred, index="SV", max_order=1)

相关示例可以在examples/nearest_neighbor/目录下找到,特别是plot_nn_data_valuation.py文件。

8. 模型比较:不同算法的解释结果对比

Shapiq可以用于比较不同模型的解释结果,帮助我们理解模型之间的差异。例如,我们可以比较线性回归和随机森林对同一数据集的解释结果。

不同阶数的n-SII值

上图展示了不同阶数的n-SII值(Shapley交互指数),可以用于比较不同模型对特征交互的捕捉能力。

要比较不同模型的解释结果,可以使用Shapiq的基准测试模块,位于src/shapiq_benchmark/目录下。

9. 高维数据解释:基因表达数据分析

高维数据(如基因表达数据)的解释是一个挑战,Shapiq提供了稀疏近似算法,可以高效地处理高维数据。

from shapiq.approximator.sparse import Spex
approximator = Spex(game=game, budget=1000)
interaction_values = approximator.approximate()

相关示例可以在examples/approximators/目录下找到,特别是plot_spex.py文件。

10. 自定义游戏:创建你自己的解释问题

Shapiq的灵活性允许你定义自己的"游戏"(即要解释的问题)。例如,你可以定义一个自定义的价值函数来评估特征子集的重要性。

import shapiq
class CountGame(shapiq.Game):
    def __init__(self, n_players):
        super().__init__(n_players=n_players)
    def value_function(self, coalitions):
        return np.sum(coalitions, axis=1)

这个示例创建了一个简单的游戏,其中特征子集的价值是子集中特征的数量。你可以根据自己的需求定义更复杂的价值函数。

总结

Shapiq是一个功能强大的机器学习可解释性工具,提供了从简单到复杂的各种解释方法。通过本文介绍的10个示例,你可以看到Shapiq在不同数据类型(表格、图像、文本)和不同模型(树模型、神经网络、线性模型)上的应用。

无论你是机器学习初学者还是资深从业者,Shapiq都能帮助你更好地理解模型决策过程,提高模型的透明度和可信度。开始使用Shapiq,探索机器学习的"黑箱"内部吧!

更多详细文档和示例可以在docs/目录下找到,特别是docs/source/introduction/目录中的入门指南。

【免费下载链接】shapiq Shapley Interactions and Shapley Values for Machine Learning 【免费下载链接】shapiq 项目地址: https://gitcode.com/gh_mirrors/sh/shapiq

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值