T5-CSBoost:对抗性扰动下的LLM文本指纹识别新突破

arXiv·4 天前

当前大多数AI生成文本检测器在原始输入上表现优异,但在面对轻微改写、词汇替换、字符编辑等对抗性扰动时性能会大幅下降。为解决这一难题,研究团队基于T5-Sentinel框架提出了T5-CSBoost方法。该方法保留了原有的下一词预测目标用于来源归属,同时在解码器嵌入层引入了基于间隔的三元组损失函数。这种对比风格正则化技术促使模型学习到紧凑且抗干扰的文本风格表征,为现有方法提供了轻量而有效的替代方案——无需修改底层T5-small架构、对抗训练或复杂的多任务目标。实验结果显示,T5-CSBoost在OpenLLMText和HC3 AIGT基准测试中实现了最先进的多类别来源归属和二元人机文本检测性能。更重要的是,该方法对高达90%强度的词汇和字符级对抗性扰动表现出显著鲁棒性,在包含未知模型、未知领域和极端改写场景的MAGE/Deepfake压力测试套件中取得最优表现。这项研究证明,通过对比学习显式正则化风格嵌入是构建现实对抗环境中更鲁棒LLM指纹识别系统的实用有效策略。

文本检测对抗性攻击大模型安全T5模型对比学习

原文来源:https://arxiv.org/abs/2607.14113

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回