OriginBlame:AI训练数据集溯源新工具,精准定位数据来源
在AI模型训练中,当数据贡献者要求删除其数据时,模型训练者面临一个难题:现有遗忘算法需要明确哪些训练记录属于特定作者,但缺乏工具进行精准定位。传统溯源系统通常工作在文件或数据集层面,导致删除范围过大,影响模型性能。
为此,研究人员开发了OriginBlame(ob)系统,该系统能够在记录和令牌级别追踪数据来源,通过数据处理管道传播作者身份信息,并利用确定性查询将撤销请求转化为精确的遗忘集。实验基于219,555个维基百科页面进行,结果显示,记录级溯源将数据集级的过度删除从101倍降至1.3倍,有效避免了大规模数据损失。
在性能方面,集成OriginBlame后,HuggingFace处理维基数据时的吞吐量开销增加1.3-4.0%,Datatrove则增加2.1-19.0%。此外,在一个17亿参数的模型上,使用基于溯源的遗忘集进行模型遗忘,其效果比随机基线提升了42%,显著提高了数据管理的精确性和效率。
这项研究为AI训练数据的管理提供了新思路,有望推动更负责任的数据使用和模型开发实践。