RoPoLL:用鲁棒统计提升大模型评委团的抗干扰能力
随着大模型评估需求的增长,由多个大模型评委组成的评审团(PoLL)已成为替代单一评委评估的实用方案。然而现有研究发现,当评委出现模式崩溃、迎合性回答或安全拒绝等典型偏差时,传统共识机制在任意微小污染下都会产生无界偏差。
来自学术机构的研究者将这一问题形式化为胡伯污染模型下的鲁棒均值估计问题,提出RoPoLL(鲁棒大模型评委团)框架。该方法保留原有评委团结构,但将聚合函数替换为无需调参的几何中位数估计器,获得最优的有限样本崩溃点1/2。理论分析显示,RoPoLL达到参数率σ√(d/N)的误差界,与信息论极小极大下界仅相差√(d)因子。
在13个开源模型评委(4B-675B参数)、三个奖励模型基准和四种污染场景的实验中,RoPoLL在所有偏差型污染中均显著优于传统方法:在计算量相同时,对跨维度攻击的改进约19%;对重尾拜占庭攻击的改进达到数量级优势。值得注意的是,仅用38B参数的3评委RoPoLL委员会在30%双峰随机污染下,其HelpSteer-2评估表现超越675B的Mistral-Large-3模型1.31倍,实现18倍的参数效率优势。对照实验证实,这种优势主要针对有偏污染而非良性噪声。