
文章主要内容与创新点总结一、主要内容本文聚焦大型语言模型(LLMs)中的“错误切片”(error slices)发现问题——即模型在特定数据子集(如特定人群相关的毒性评论识别任务)上表现出的系统性错误。传统切片发现多为无监督方式,依赖大量人工标注且效果有限,因此本文提出“主动切片发现”(Active Slice Discovery)框架,通过主动学习策略,利用有限的人工标注验证样本是否属于同一错误切片,高效挖掘潜在的系统性错误模式。研究以毒性分类任务为实验场景,基于Jigsaw毒性数据集和Llama 3.1模型,探究了不同特征表示(LLM原始层嵌入、稀疏自编码器SAE激活值)、分类器(MLP、SVM)和主动学习查询策略(不确定性基于策略、多样性基于策略、随机采样)的效果。实验结果表明:不确定性基于的主动学习策略(如最小置信度、预测熵等)效果最优,仅需2%-10%的切片成员信息即可达到接近全量标注的准确率;特征表示影响切片发现效率,SAE特征能提升训练稳定性,且对异质性、情感类切片的识别效果更优;简单模型(如SVM)结合高质量特征(SAE)无需复杂超参数调优,即可达到与复杂模型(MLP)相当的性能,且标注需求显著降低(最多减少98%)。二、创新点首次形式化定义“主动切片发现”问题,将主动学习与切片发现结合,突破传统无监督切片发现的局限,为系统性错误挖掘提供新范式;构建灵活的主动切片发现流水线,支持不同基础模型、特征表示、分类器和主动学习策略的组合,且源码将公