超越困惑度:大语言模型测试时训练中部署记忆声明的行为评估框架

arXiv·19 天前

当前大语言模型测试时训练(TTT)的评估多依赖局部代理指标,如困惑度、未来词元损失、长上下文性能或奖励分数。这些指标虽能有效衡量流式适应、领域适应、上下文压缩和奖励支持的测试时改进,但对于评估部署后记忆、个性化或稀疏部署后学习等实际能力存在局限。研究指出,验证这些能力需要行为证据,包括后续回忆、释义鲁棒性、保持性、局部性、冲突处理以及原始支持上下文移除后的下游行动使用。

为此,研究团队提出了一个行为评估框架,将TTT记忆声明与支持证据进行校准。该框架包含两个核心组件:一是声明校准的证据阶梯,区分流式/领域适应、桥梁内化和部署时行为学习;二是包含匹配显式记忆基线和互斥失败类别的评估协议。研究通过在稀疏临时事实设置中进行控制诊断验证了框架的有效性:在一阶LoRA更新降低三个不同规模Qwen模型的支持和回答损失的同时,生成的自自回忆保持为零,揭示了代理改进与部署行为之间的可测量差距。

该框架为研究者和评估者提供了将TTT记忆声明与实际报告证据对齐的具体标准,有助于更准确地评估模型在真实部署环境中的能力。

大语言模型测试时训练评估框架记忆机制行为验证

原文来源:https://arxiv.org/abs/2607.00368

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回