研究发现:GPT-2预训练权重谱可复用,但单纯模仿光谱特征不足以提升模型性能
近日,一项发表于arXiv的研究探讨了预训练语言模型权重谱的复用可能性。研究团队分析了11个不同规模、语言、分词器和训练语料的GPT-2风格模型检查点,测量了各层及Transformer子组件的Frobenius范数和有效秩熵。结果显示,这些模型在深度维度上存在共享趋势,特别是在残差写入矩阵中表现出更强的光谱集中性。
研究人员尝试构建能模仿预训练模型组件级幅值和光谱特征的初始化方案,并与多种权重初始化方法进行比较。实验发现,虽然这些初始化器明显改变了模型的结构光谱模式,但评估结果并未显示出相应的性能优势。预训练权重复用仍保持竞争力,而单纯的光谱匹配并非可靠的优化策略。
研究结论表明,预训练光谱可作为训练模型结构的有用诊断工具,但要实现有效复用,可能需要保留比组件级尺度和奇异值形状更丰富的信息。该研究为理解预训练模型的内在结构提供了新视角,同时提示未来研究需探索更精细的权重初始化策略。