自引导测试时训练:提升大模型长文本理解能力的新方法
随着大语言模型应用场景的扩展,处理长文本输入已成为关键能力。然而,单纯扩展上下文窗口并不能保证模型有效利用长文本信息——当输入长度增加时,模型准确率往往下降,表明其仍难以精准定位与问题最相关的证据片段。
测试时训练是一种有前景的改进思路,它将测试文本视为训练样本进行参数适配。但传统方法存在明显缺陷:对整个长文本进行训练计算成本过高,而随机采样片段训练又会引入大量噪声。由于长文本中大部分内容与特定问题无关,在这些无关片段上训练反而可能损害基础模型的性能。
研究团队发现,训练片段的质量对测试时训练效果至关重要。在LongBench-v2基准测试中,随机片段训练会降低性能,而使用理想片段训练则能显著提升效果。基于这一发现,研究人员提出了自引导测试时训练方法:在参数适配前,模型首先自主识别应学习的关键证据片段,随后仅在这些选定片段上应用标准语言建模训练目标。
该方法在LongBench-v2和LongBench-Pro两个长文本推理基准测试中表现优异,使Qwen3-4B-Thinking-2507和Llama-3.1-8B-Instruct模型的准确率获得最高15%的相对提升,为提升大模型长文本理解能力提供了新思路。