Active Slice Discovery in Large Language Models

文章主要内容与创新点总结

一、主要内容

本文聚焦大型语言模型(LLMs)中的“错误切片”(error slices)发现问题——即模型在特定数据子集(如特定人群相关的毒性评论识别任务)上表现出的系统性错误。传统切片发现多为无监督方式,依赖大量人工标注且效果有限,因此本文提出“主动切片发现”(Active Slice Discovery)框架,通过主动学习策略,利用有限的人工标注验证样本是否属于同一错误切片,高效挖掘潜在的系统性错误模式。

研究以毒性分类任务为实验场景,基于Jigsaw毒性数据集和Llama 3.1模型,探究了不同特征表示(LLM原始层嵌入、稀疏自编码器SAE激活值)、分类器(MLP、SVM)和主动学习查询策略(不确定性基于策略、多样性基于策略、随机采样)的效果。实验结果表明:

  1. 不确定性基于的主动学习策略(如最小置信度、预测熵等)效果最优,仅需2%-10%的切片成员信息即可达到接近全量标注的准确率;
  2. 特征表示影响切片发现效率,SAE特征能提升训练稳定性,且对异质性、情感类切片的识别效果更优;
  3. 简单模型(如SVM)结合高质量特征(SAE)无需复杂超参数调优,即可达到与复杂模型(MLP)相当的性能,且标注需求显著降低(最多减少98%)。

二、创新点

  1. 首次形式化定义“主动切片发现”问题,将主动学习与切片发现结合,突破传统无监督切片发现的局限,为系统性错误挖掘提供新范式;
  2. 构建灵活的主动切片发现流水线,支持不同基础模型、特征表示、分类器和主动学习策略的组合,且源码将公
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值