文本分类性能评估新方法:如何更准确计算LLM置信区间
随着文本分类在社会科学研究中的广泛应用,研究人员常使用监督模型或大语言模型从自然语言中测量结构,并以召回率、精确度等指标作为有效性证据。然而,这些点估计指标存在抽样变异,且不确定性度量报告往往不一致。传统方法在小规模标注数据集或高性能场景下准确性不足。
本研究系统评估了在典型社会科学文本分类条件下的置信区间方法,包括中小样本量、低频结构和文本嵌套于个体等情况。模拟实验显示,Wald区间和基本百分位bootstrap等默认方法准确性最低,覆盖率有时远低于名义95%水平。而Agresti-Coull、Wilson、Clopper-Pearson方法以及新提出的伪计数正则化bootstrap(特别适用于F1计算)能显著提升准确性。
当文本嵌套于个体时,研究证明必须同时调整有效N和适当自由度才能产生准确的分析区间。在bootstrap区间中,分层bootstrap在个体产生中等数量文本时更准确,但在个体仅产生少量文本时过于保守。该研究为领域提供了适当的区间估计指导,旨在提升机器学习应用的透明度,并鼓励在设计阶段更关注验证样本量。