文本数据集蒸馏新方法TAKE:仅需0.1%数据保持任务性能

arXiv·6 天前

随着大语言模型的快速发展,大规模文本语料库已成为自然语言处理领域的重要瓶颈,不仅体现在存储成本上,更在于训练、微调和持续学习过程中积累的巨额计算开销。近日,研究人员在arXiv上发布了一项创新研究,提出名为TAKE的文本数据集蒸馏框架,该技术能够将原始文本数据集压缩至仅0.1%的规模,同时保持下游任务的性能表现。

TAKE方法的核心创新在于轨迹感知知识估计技术。该方法通过影响函数量化每个训练样本对下游目标的贡献度,并沿着训练轨迹将基于知识的影响进行卷积处理,最终为每个样本生成单一的知识评分。这些评分能够准确识别出最具信息量的样本,为数据集压缩提供理论依据。

在具体实现上,研究团队将知识评分作为样本权重,结合离散最优传输目标,从合成生成的候选池中筛选出最具代表性的原型样本。实验表明,即使在极端压缩条件下(0.1%数据或每类仅20个样本),TAKE方法在文本分类和自然语言推理任务上仍能保持优异的准确率,证明了数据效率与任务保真度可以兼得。

这项研究不仅为文本数据集压缩提供了理论支撑,对核心集构建和数据为中心的AI研究也具有广泛意义。研究团队已在GitHub开源相关代码,为后续研究提供技术基础。该方法的提出,有望缓解当前NLP领域面临的数据存储和计算成本压力,推动更高效的大规模语言模型训练范式发展。

数据集蒸馏自然语言处理模型压缩机器学习开源工具

原文来源:https://arxiv.org/abs/2607.11898

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回