无需模型评分也能选测试题:新方法用语义特征压缩大模型评测集

arXiv·7 天前

在最新arXiv论文中,研究者针对大模型基准测试提出了一种创新的评测集压缩方法。传统方法需要依赖模型的实际评分结果来选择代表性测试题,而新方法完全无需模型评估数据,仅通过分析提示的语义嵌入特征就能完成选择。该方法采用子模子集选择技术,包括基于行列式点过程、子模互信息函数和设施选址函数等多种方案。研究团队在包含35个异构基准测试、覆盖5种能力类别、涉及18个前沿大模型和超过6.1万个提示的大规模测试集上验证发现:仅使用廉价语义嵌入的设施选址函数,在多种压缩预算下都能比12个基于评分或多样性的基线方法更好地保持模型评分和排名。值得注意的是,该方法不仅限于无监督场景——当需要选择少量完整基准测试且已有大量模型评分时,相同目标函数在MMLU和MTEB排行榜上也能达到或超越现有最优方法,同时计算成本显著降低。这些结果表明,子模性是一种强大可靠的基准测试压缩工具,有望大幅降低大模型评估的计算负担。

大模型评测基准测试子模优化语义嵌入arXiv

原文来源:https://arxiv.org/abs/2607.09739

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回