动态靶标下的AI文本检测:持续分布漂移中的测试时自适应新方法
当前AI文本检测系统普遍依赖训练阶段获取的人类写作与AI生成文本标注数据,但这种方法在部署后持续面临三类分布漂移挑战:对抗性人类化改写、新型大语言模型不断涌现、人类写作风格随时间自然演变。这些变化往往缺乏标注数据支持,导致现有检测方法性能严重退化。
研究团队创新性地提出测试时自适应框架,利用大语言模型使用时产生的关键信号——推理时间同质性,通过半监督学习在推理阶段自适应调整检测策略。实验数据表明,当遭遇对抗性AI生成文本时,商业检测模型Pangram仅能识别24.1%的样本,而采用测试时自适应方法的检测准确率高达90.5%。
该研究首次系统论证了测试时自适应在真实场景AI文本检测中的有效性,为应对快速演变的文本生成技术提供了新思路。团队已公开全部代码库,包含模型训练、评估及可视化工具,推动该领域研究可复现性发展。