自引导测试时训练:提升大模型长文本理解能力的新方法

arXiv·8 天前

随着大语言模型应用场景的扩展,处理长文本输入已成为关键能力。然而,单纯扩展上下文窗口并不能保证模型有效利用长文本信息——当输入长度增加时,模型准确率往往下降,表明其仍难以精准定位与问题最相关的证据片段。

测试时训练是一种有前景的改进思路,它将测试文本视为训练样本进行参数适配。但传统方法存在明显缺陷:对整个长文本进行训练计算成本过高,而随机采样片段训练又会引入大量噪声。由于长文本中大部分内容与特定问题无关,在这些无关片段上训练反而可能损害基础模型的性能。

研究团队发现,训练片段的质量对测试时训练效果至关重要。在LongBench-v2基准测试中,随机片段训练会降低性能,而使用理想片段训练则能显著提升效果。基于这一发现,研究人员提出了自引导测试时训练方法:在参数适配前,模型首先自主识别应学习的关键证据片段,随后仅在这些选定片段上应用标准语言建模训练目标。

该方法在LongBench-v2和LongBench-Pro两个长文本推理基准测试中表现优异,使Qwen3-4B-Thinking-2507和Llama-3.1-8B-Instruct模型的准确率获得最高15%的相对提升,为提升大模型长文本理解能力提供了新思路。

大语言模型长文本处理测试时训练模型优化推理能力

原文来源:https://arxiv.org/abs/2607.09415

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回