AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
AI评估
10 篇相关内容
相关话题
arXiv
基准测试
大语言模型
arXiv研究
研究框架
机器学习
对话系统
可解释AI
零售科技
长文档推理
基准评测
证据整合
如何设计优质AI基准测试:五大核心标准解析
研究提出优质AI基准测试应具备正确性、可解性、可验证性、明确性与挑战性五大特征,强调测试需模拟真实场景并验证结果而非方法。
a
arXiv
·
6 天前
基准测试
AI评估
研究框架
arXiv
a
零售对话AI评估新框架:兼顾多维度与可审计的大规模评测系统
研究者提出GenAI评估框架,通过配置化管道对零售对话系统进行大规模多维度评估,每日处理约5万条记录,支持选择性重评与完整审计追踪。
a
arXiv
·
6 天前
对话系统
AI评估
大语言模型
可解释AI
a
WILDTRACE:首个自然证据链长文档推理基准,挑战AI深层理解能力
研究者发布WILDTRACE基准数据集,专注于评估AI模型在长文档中整合自然分散证据的能力,包含481个任务和214个真实场景文档,填补了现有基准在真实世界推理评估上的空白。
a
arXiv
·
8 天前
长文档推理
基准评测
证据整合
自然语言处理
a
世界模型新角色:从参赛者到裁判员,AI决策评估迎来新范式
研究人员提出利用世界模型作为评估AI决策质量的“裁判”,为强化学习等任务提供更高效、更可靠的评估方案。
a
arXiv
·
18 天前
世界模型
AI评估
强化学习
决策系统
a
AI能力评估现分歧:指标选择将决定技术普惠方向
最新研究揭示,AI模型能力的评估方式将直接影响技术资源分配格局——采用有界或无界性能指标,会得出截然相反的结论,进而决定尖端能力是集中于少数巨头还是普惠于广大开发者。
a
arXiv
·
19 天前
AI评估
计算规模
技术普惠
性能指标
a
Seed2.0模型卡发布:迈向解决现实复杂任务的新一步
研究团队推出Seed2.0模型系列,通过建立以用户真实需求为导向的评估体系,显著提升了模型在长尾知识和复杂指令跟随方面的能力,并在推理、视觉理解和搜索等核心领域达到领先水平。
a
arXiv
·
19 天前
大模型
Seed2.0
AI评估
复杂任务
a
OpenAI推出GeneBench-Pro:专为基因组学与生物学设计的AI性能基准测试
OpenAI发布GeneBench-Pro基准测试,旨在评估AI在基因组学、生物学及科学研究中使用复杂真实数据集的表现。
O
OpenAI
·
20 天前
基准测试
OpenAI
基因组学
AI评估
O
人类放弃思考时,推理模型仍在坚持:揭示AI与人类决策的根本差异
最新研究发现,大型推理模型与人类在面对难题时表现出相反的决策模式:模型在答错时会消耗更多计算资源,而人类则倾向于在答错时提前放弃。
a
arXiv
·
25 天前
推理模型
决策机制
人机对比
认知科学
a
RIFT-Bench:面向智能体AI系统的动态红队测试新框架
研究者提出RIFT-Bench,一种基于图表示的动态红队测试方法,可对异构智能体AI系统进行统一安全评估,支持攻击探测与防御策略测试。
a
arXiv
·
27 天前
智能体安全
红队测试
AI评估
大语言模型
a
超越静态排行榜:如何更准地评估LLM智能体?
研究发现传统AI智能体排行榜的排名在真实部署场景中不稳定,提出用“预测效度”替代平均分来评估智能体,并设计了一套12层评估框架。
a
arXiv
·
31 天前
LLM智能体
AI评估
预测效度
基准测试
a