多层感知机对抗鲁棒性:基于格遍历的区间认证新框架
arXiv最新研究针对AI安全核心问题——对抗鲁棒性,提出了一套严谨的理论框架。该研究创新性地将对抗鲁棒性问题转化为格遍历问题,其中每个格元素对应一个包含输入点x的轴对齐超矩形区间。
研究定义了两种认证类型:若区间I包含x,且x在I内任意扰动都不会改变多层感知机(MLP)的分类结果,则I构成可靠认证;若x在I内,且当x移出I时MLP预测必然改变,则I构成完备认证。前者对应传统对抗鲁棒性研究,后者则是首次在文献中被系统探讨。
团队开发了格遍历算子,采用“精化-验证”迭代方案,结合形式化MLP验证器,保证了可靠认证的最大性和完备认证的最小性。研究还揭示了有趣的算法不对称性:完备认证的最小解可在多项式时间内获得,而可靠认证则被证明具有强难解性。在对称区间优化问题上,研究者提出了对数级复杂度的算法。
实证评估采用新型ParallelepipedoNN系统验证了理论成果,为神经网络安全认证提供了新的方法论基础。