多层感知机对抗鲁棒性:基于格遍历的区间认证新框架

arXiv·8 天前

arXiv最新研究针对AI安全核心问题——对抗鲁棒性,提出了一套严谨的理论框架。该研究创新性地将对抗鲁棒性问题转化为格遍历问题,其中每个格元素对应一个包含输入点x的轴对齐超矩形区间。

研究定义了两种认证类型:若区间I包含x,且x在I内任意扰动都不会改变多层感知机(MLP)的分类结果,则I构成可靠认证;若x在I内,且当x移出I时MLP预测必然改变,则I构成完备认证。前者对应传统对抗鲁棒性研究,后者则是首次在文献中被系统探讨。

团队开发了格遍历算子,采用“精化-验证”迭代方案,结合形式化MLP验证器,保证了可靠认证的最大性和完备认证的最小性。研究还揭示了有趣的算法不对称性:完备认证的最小解可在多项式时间内获得,而可靠认证则被证明具有强难解性。在对称区间优化问题上,研究者提出了对数级复杂度的算法。

实证评估采用新型ParallelepipedoNN系统验证了理论成果,为神经网络安全认证提供了新的方法论基础。

对抗鲁棒性形式化验证神经网络安全AI安全理论框架

原文来源:https://arxiv.org/abs/2607.08773

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回