研究观点:LLM领域“机器遗忘”一词被滥用,需正本清源
随着大语言模型面临数据删除法规、版权争议及安全政策等要求,“遗忘”训练数据、知识或行为的需求日益增长。然而,最新发布于arXiv的立场论文指出,“机器遗忘”这一术语在LLM研究领域正被过度使用。论文主张,该术语应严格限定指代“数据集定义的删除”:即通过移除特定遗忘集的训练影响,使最终模型近似等同于未使用该数据重新训练的版本。
作者指出,当前许多被标记为“遗忘”的任务(如拒绝有害请求、实体/知识移除、定向抑制等)实则追求不同的、常依赖于策略的目标,因此需要更精确的术语区分,例如对齐、抑制、编辑或混淆。这种术语混淆并非表面问题:由于不同研究在相同标签下隐含不同的保证承诺,评估指标与基准常被误用于非设计场景,导致仅奖励表面上的非披露性(如低ROUGE分数或遗忘准确率),而未检验是否真正实现“重新训练等效性”或能力是否残留。
论文最后呼吁,研究社区应建立与明确保证承诺及参考模型紧密关联的严格术语体系,并设计符合声称目标的评估方法,以推动该领域更清晰、可比较的学术讨论与技术发展。