大模型上下文学习的不确定性量化:提出自函数向量新方法
上下文学习(ICL)让大语言模型通过少量示例适应新任务,但其可靠性一直备受关注:预测结果对提示设计和模型理解能力高度敏感,难以区分错误源于数据特性还是模型局限。不确定性分解——区分随机不确定性与认知不确定性——在这一场景下尤为重要,但现有方法主要针对标准生成任务设计,无法捕捉ICL的独特动态。
为解决这一问题,研究团队基于贝叶斯视角和ICL的机制可解释性,提出了“自函数向量”新概念。这些向量利用模型内部表示来建模在上下文提示过程中学到的潜在概念,从而在贝叶斯框架内直接估计随机不确定性,避免了依赖脆弱的输入或解码操作。
由于缺乏成熟的基准测试和合适的评估方案,研究团队还提出了首个严谨的评估协议:通过受控方式操纵数据,精确量化随机不确定性并与认知不确定性分离。基于这一新评估框架(先在合成任务中概念验证,后扩展至真实数据集),研究表明所提方法比现有替代方案能更可靠地测量ICL下大模型预测的不确定性。
该方法还可作为实用工具应用于可信相关任务,如幻觉检测。这项研究为连接不确定性的量化视角与模型行为的机制理解开辟了新方向。