文本分类性能评估新方法:如何更准确计算LLM置信区间

arXiv·25 天前

随着文本分类在社会科学研究中的广泛应用,研究人员常使用监督模型或大语言模型从自然语言中测量结构,并以召回率、精确度等指标作为有效性证据。然而,这些点估计指标存在抽样变异,且不确定性度量报告往往不一致。传统方法在小规模标注数据集或高性能场景下准确性不足。

本研究系统评估了在典型社会科学文本分类条件下的置信区间方法,包括中小样本量、低频结构和文本嵌套于个体等情况。模拟实验显示,Wald区间和基本百分位bootstrap等默认方法准确性最低,覆盖率有时远低于名义95%水平。而Agresti-Coull、Wilson、Clopper-Pearson方法以及新提出的伪计数正则化bootstrap(特别适用于F1计算)能显著提升准确性。

当文本嵌套于个体时,研究证明必须同时调整有效N和适当自由度才能产生准确的分析区间。在bootstrap区间中,分层bootstrap在个体产生中等数量文本时更准确,但在个体仅产生少量文本时过于保守。该研究为领域提供了适当的区间估计指导,旨在提升机器学习应用的透明度,并鼓励在设计阶段更关注验证样本量。

文本分类置信区间大语言模型评估方法机器学习

原文来源:https://arxiv.org/abs/2606.26422

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回