AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
研究框架
2 篇相关内容
相关话题
基准测试
AI评估
arXiv
机器学习
语言模型
AI安全
风险评估
CBRN威胁
如何设计优质AI基准测试:五大核心标准解析
研究提出优质AI基准测试应具备正确性、可解性、可验证性、明确性与挑战性五大特征,强调测试需模拟真实场景并验证结果而非方法。
a
arXiv
·
6 天前
基准测试
AI评估
研究框架
arXiv
a
前沿语言模型风险评估新框架:如何量化AI对生化核威胁的“助推”作用
研究人员提出“阈值超越标准”框架,系统评估前沿语言模型是否实质提升非专业人士策划高危生化核威胁的能力。实证研究发现,模型辅助在放射领域存在确认的助推效应,但其他领域效果有限。
a
arXiv
·
6 天前
语言模型
AI安全
风险评估
CBRN威胁
a