AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
基准测试
35 篇相关内容
相关话题
大语言模型
arXiv
智能体
评估方法
提示工程
AI评估
多语言AI
视觉问答
模型评估
具身智能
人机交互
AI代理
日本运筹学基准JOR-Bench发布:评估大语言模型解决实际优化问题能力
研究人员推出首个日语运筹学基准JOR-Bench,包含1319个优化问题,用于评估大语言模型在多语言环境下解决实际业务问题的能力。
a
arXiv
·
5 小时前
大语言模型
基准测试
运筹学
多语言AI
a
小模型也能大作为:结构化基准测试与高效微调推动AI民主化
最新研究通过结构化基准测试和参数高效微调,证明3B参数以下的小型语言模型经过专门优化后,可在本地硬件约束下胜任结构化专业任务,为AI民主化提供可行路径。
a
arXiv
·
5 小时前
小语言模型
AI民主化
参数高效微调
本地部署
a
首个建筑图纸多模态推理基准发布,大模型表现与专家差距显著
研究人员推出首个针对真实世界建筑图纸的多模态大语言模型评测基准DrawingVQA,涵盖33份施工图纸和92个专业问答对,评估发现当前先进模型在深层推理任务上与专家水平存在明显差距。
a
arXiv
·
1 天前
多模态大语言模型
建筑图纸
基准测试
工程AI
a
提示工程“简单”反而更强?研究揭示LLM评估中的“简洁性悖论”
一项大规模实证研究发现,在多项选择题问答任务中,简单的基线提示法往往优于复杂的推理提示技术,挑战了“越复杂越好”的普遍假设。
a
arXiv
·
4 天前
大语言模型
提示工程
模型评估
多项选择题问答
a
UESF-Bench:首个统一化具身智能寻人跟随基准发布
研究者提出首个统一化具身智能寻人跟随基准UESF-Bench,解决现有基准将搜索与跟随任务割裂的问题,并推出SeekFollow-VLA框架实现任务自适应切换。
a
arXiv
·
5 天前
具身智能
人机交互
基准测试
多模态学习
a
LakeQuest基准:三大领域数据湖问答系统面临真实挑战
研究人员推出LakeQuest基准测试,包含近万个人工验证的问答对,覆盖AI/ML、零售银行和生物医学三大领域,揭示现代问答系统在真实数据湖环境中的关键缺陷。
a
arXiv
·
6 天前
数据湖
问答系统
基准测试
RAG
a
AI代理前瞻记忆大挑战:PM-Bench基准揭示LLM执行延迟意图的困境
研究者推出PM-Bench基准测试,专门评估大语言模型代理的前瞻记忆能力。测试显示当前最先进的GPT-5.4代理仅获得65.1%的F1分数,凸显AI代理在延迟意图执行方面的重大挑战。
a
arXiv
·
6 天前
大语言模型
AI代理
基准测试
认知科学
a
智能体评测需要多少任务才够?公开LLM智能体基准测试的回放分析
研究通过回放SWE-bench、AppWorld等公开基准测试数据,发现部分任务运行往往无法得出与完整测试相同的结论,不同基准所需任务比例差异显著。
a
arXiv
·
6 天前
智能体评测
基准测试
LLM评估
研究方法
a
AI代理“工具进化”真的有效吗?新研究质疑现有评估方法
最新研究重新审视了大语言模型代理自动工具进化的评估方法,发现现有评估协议存在根本性缺陷,可能导致结果夸大。
a
arXiv
·
6 天前
大语言模型
AI代理
评估方法
工具进化
a
如何设计优质AI基准测试:五大核心标准解析
研究提出优质AI基准测试应具备正确性、可解性、可验证性、明确性与挑战性五大特征,强调测试需模拟真实场景并验证结果而非方法。
a
arXiv
·
6 天前
基准测试
AI评估
研究框架
arXiv
a
BatteryLake:基于智能体与物理知识的电池老化数据治理平台
研究团队推出BatteryLake平台,通过智能体驱动的物理知识融合框架,将分散的电池老化数据集转化为标准化基准测试资源,解决了电池数据格式不一、元数据缺失等长期难题。
a
arXiv
·
7 天前
电池管理
数据治理
大语言模型
基准测试
a
无需模型评分也能选测试题:新方法用语义特征压缩大模型评测集
研究者提出一种无监督的大模型评测集压缩方法,仅依赖提示的语义嵌入就能选出代表性测试题,在35个基准测试上验证了有效性。
a
arXiv
·
7 天前
大模型评测
基准测试
子模优化
语义嵌入
a
提示词格式敏感度:大模型评测中格式包装对准确率的影响
研究发现,评测大模型时仅改变提示词的格式包装,就可能导致准确率大幅波动,甚至改变排行榜结论。研究人员提出格式敏感度指数与解析敏感度指数,量化这一影响。
a
arXiv
·
7 天前
大模型评测
提示工程
格式敏感度
基准测试
a
医疗AI新基准:LongMedBench评估大模型长期临床决策能力
研究者推出首个基于真实电子病历的长期临床决策基准LongMedBench,填补了现有评估在长时程医疗场景中的空白。该基准通过整合患者多次就诊记录,系统评估AI医疗代理在事实问答、时序推理和长期决策三方面的表现。
a
arXiv
·
8 天前
医疗AI
临床决策
基准测试
大语言模型
a
长视野终端基准发布:AI智能体面临极限挑战
研究者推出长视野终端基准测试,包含46项需数小时完成的任务,旨在评估AI智能体在复杂长流程任务中的表现。测试显示当前最强模型仅达15.2%通过率,揭示巨大提升空间。
a
arXiv
·
8 天前
AI智能体
基准测试
长流程任务
评估框架
a
ISOSCI基准:揭秘大模型推理能力与知识检索的真实关系
研究团队推出ISOSCI基准测试,通过同构跨学科科学问题对分离大模型的推理能力与领域知识检索,发现当前推理模式提升主要依赖知识而非纯逻辑结构。
a
arXiv
·
18 天前
基准测试
大模型评估
推理能力
知识检索
a
首个办公文档理解基准OCB发布,GPT-4o仅得59.3分
研究者推出首个面向Word、Excel、PowerPoint原生格式的综合性基准OCB,测试显示当前最强模型在专业领域问答中仅获59.3%准确率。
a
arXiv
·
18 天前
基准测试
办公文档
多模态理解
评估方法
a
提示框架扭曲大语言模型错误检测评估:锚定效应导致F1虚高
研究发现,基于计数的F1指标可能因提示框架中的数字锚定效应而虚高,无法真实反映大语言模型的错误定位能力。
a
arXiv
·
18 天前
大语言模型
评估方法
语法纠错
提示工程
a
知识型视觉问答基准测试的缺陷识别与修复
研究发现现有知识型视觉问答基准测试存在系统性缺陷,导致模型能力被高估。团队提出审计修复方案并构建增强数据集,推动更可靠的评估方法。
a
arXiv
·
19 天前
视觉问答
基准测试
评估方法
多模态AI
a
AGI Maze:世界建模智能体新基准,LLM 推理能力面临挑战
研究者提出 AGI Maze 基准框架,用于评估智能体在部分可观测环境中的世界建模能力,实验显示当前 LLM 难以在推理时内部表示迷宫状态,即使借助记忆机制仍无法可靠解决简单任务。
a
arXiv
·
19 天前
基准测试
世界建模
大语言模型
推理能力
a
PHREEQC-MCQ-200:科学模拟器智能体工具增强能力诊断基准发布
研究人员推出PHREEQC-MCQ-200基准测试,专门评估大语言模型智能体在水文地球化学模拟中的工具使用能力,揭示工具接入并非总能提升性能的科学诊断价值。
a
arXiv
·
19 天前
大语言模型
科学计算
基准测试
工具增强
a
大语言模型也会被诡辩带偏?LoFa基准测试揭示逻辑谬误攻击下的模型脆弱性
研究者提出首个专门评估大语言模型抵抗逻辑谬误攻击能力的基准测试LoFa,发现不同模型在面对各类诡辩手法时表现出显著差异的脆弱性。
a
arXiv
·
20 天前
大语言模型
基准测试
逻辑推理
模型安全
a
印度语言罗马化混码基准发布,大模型跨语言指令理解面临新挑战
研究人员推出首个评估大语言模型处理罗马化印度语-英语混合指令的基准Indi-RomCoM,发现现有模型在混合语言任务中表现显著下降。
a
arXiv
·
20 天前
大语言模型
多语言处理
基准测试
代码混合
a
OpenAI推出GeneBench-Pro:专为基因组学与生物学设计的AI性能基准测试
OpenAI发布GeneBench-Pro基准测试,旨在评估AI在基因组学、生物学及科学研究中使用复杂真实数据集的表现。
O
OpenAI
·
20 天前
基准测试
OpenAI
基因组学
AI评估
O
SEATauBench:首个面向东南亚语言的AI智能体评估基准发布
研究团队推出SEATauBench基准,专门用于评估AI智能体在东南亚五种语言(中文、越南语、泰语、印尼语、菲律宾语)中的工具使用与任务执行能力,填补了该领域多语言评估的空白。
a
arXiv
·
21 天前
多语言AI
智能体评估
东南亚语言
本地化AI
a
AI社交盲区:NormAct揭示大模型在具身规划中难以察觉隐藏社会规范
研究团队推出NormAct基准测试,发现多模态大语言模型在具身规划任务中,虽能完成67.3%的显性目标,但对隐藏社会规范的遵从率仅26.4%。
a
arXiv
·
22 天前
具身智能
多模态大模型
社会规范
基准测试
a
当AI评测饱和后:CORE-Bench揭示的六大性能维度
研究发现,当AI评测基准达到准确率饱和后,不应简单废弃,而应转向评估构造有效性、泛化能力、效率等六个关键维度。CORE-Bench案例展示了超越准确率的全面评估方法。
a
arXiv
·
25 天前
AI评测
基准测试
模型评估
可复现性
a
iLLaDA:8B参数双向扩散语言模型,非自回归训练展现竞争力
研究者提出iLLaDA模型,采用完全双向注意力的掩码扩散目标进行训练,在多项基准测试中显著超越前代LLaDA模型,并与主流自回归模型表现相当。
a
arXiv
·
26 天前
iLLaDA
扩散模型
语言模型
非自回归
a
医疗AI评估新突破:MedBench v5引入动态过程导向与幻觉监测
研究者推出MedBench v5临床多模态模型基准测试,从静态问答转向动态过程评估,首次整合幻觉传播监测与可控压力测试,揭示模型任务表现与过程稳定性之间的关键差异。
a
arXiv
·
27 天前
医疗AI
基准测试
多模态模型
幻觉检测
a
ParallelKernelBench评测:前沿大模型尚难编写高效多GPU计算内核
最新基准测试显示,当前最先进的大语言模型在87项真实多GPU计算任务中,仅能完成不到三分之一的高效内核编写,但部分生成代码已超越公开实现。
T
Together AI
·
27 天前
大语言模型
并行计算
代码生成
GPU编程
T
Anthropic 推出新基准:评估大语言模型生成漏洞利用的能力
Anthropic 发布了两项新的学术基准测试,用于衡量 AI 模型生成漏洞利用代码的能力,并更新了智能合约漏洞利用的评估标准。
A
Anthropic
·
27 天前
大语言模型
AI安全
基准测试
Anthropic
A
NVIDIA Blackwell横扫MLPerf训练6.0基准测试,创下最快、最大、最强纪录
NVIDIA Blackwell平台在MLPerf训练6.0基准测试中全面领先,在大型语言模型训练任务中展现出卓越的性能与扩展能力。
N
NVIDIA AI
·
27 天前
NVIDIA
Blackwell
MLPerf
AI训练
N
开源模型工具调用能力大考:你的Agent够“智能体”吗?
Hugging Face发布新基准测试,帮助开发者评估开源模型在自定义工具调用与智能体任务中的实际表现。
H
Hugging Face
·
27 天前
开源模型
智能体
基准测试
工具调用
H
超越静态排行榜:如何更准地评估LLM智能体?
研究发现传统AI智能体排行榜的排名在真实部署场景中不稳定,提出用“预测效度”替代平均分来评估智能体,并设计了一套12层评估框架。
a
arXiv
·
31 天前
LLM智能体
AI评估
预测效度
基准测试
a
LLM智能体如何主动寻求澄清?新研究提出不确定性分解方法
研究人员提出一种基于提示的不确定性分解方法,使大语言模型智能体能够区分行动信心与请求不确定性,在任务描述模糊时主动寻求澄清。该方法在多个基准测试中显著提升了澄清能力。
a
arXiv
·
31 天前
大语言模型
智能体
不确定性
人机交互
a