前沿大模型竟不会“抄作业”?研究者提出2D文本表示新思路
近日,一项发表在arXiv上的研究揭示了一个令人意外的现象:虽然大语言模型(LLM)能够在数秒内解决复杂的推理问题,但即使是当前最前沿的模型,也难以完成一个看似简单的任务——精确复制一段完全在其上下文窗口内的输入字符串。
研究团队将这一失败归因于Transformer架构中的位置编码机制。现有的位置编码存在一种归纳偏置,使得模型倾向于通过匹配局部上下文这种“捷径”来复制文本,而非仔细定位对应的输入位置。这种机制在处理需要精确位置对齐的任务时显得力不从心。
为解决此问题,研究者创新性地提出了“2D-RoPE”方法。该方法不再将文本视为传统的一维序列,而是将其组织成一个二维网格。每个词元(token)被赋予一个行ID和一个列ID。在这种视角下,复制任务简化为在固定的列偏移量处检索输入词元,使得任务变得易于学习。
在合成复制实验中,配备2D-RoPE的浅层Transformer模型,在输入长度达到训练时所见长度数百倍的情况下,仍能实现完美复制,而采用标准位置编码的模型则远远落后。研究进一步表明,在包含高达14亿参数的大规模预训练(DCLM数据集)中,2D-RoPE语言模型在复制任务上的优势依然稳固。
总体而言,这项研究表明,将文本视为二维结构可以为语言建模带来益处。研究者希望这一发现能激励未来的工作进一步探索二维位置编码的潜力,为解决大模型在精确文本操作方面的局限性提供新思路。