AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
大模型评估
3 篇相关内容
相关话题
基准测试
推理能力
知识检索
科学问题
校准技术
AI公平性
模型比较
准确率控制
鲁棒统计
评委团机制
几何中位数
arXiv研究
ISOSCI基准:揭秘大模型推理能力与知识检索的真实关系
研究团队推出ISOSCI基准测试,通过同构跨学科科学问题对分离大模型的推理能力与领域知识检索,发现当前推理模式提升主要依赖知识而非纯逻辑结构。
a
arXiv
·
18 天前
基准测试
大模型评估
推理能力
知识检索
a
大模型校准评估新突破:准确率控制框架揭示排名反转现象
研究者提出ACE评估框架,发现传统校准指标在跨模型比较时存在偏差,准确率控制后模型校准排名常发生反转。
a
arXiv
·
20 天前
大模型评估
校准技术
AI公平性
模型比较
a
RoPoLL:用鲁棒统计提升大模型评委团的抗干扰能力
研究团队提出RoPoLL方法,通过引入几何中位数等鲁棒统计量改进大模型评委团的共识机制,显著提升评估系统在数据污染攻击下的稳定性。
a
arXiv
·
20 天前
大模型评估
鲁棒统计
评委团机制
几何中位数
a