AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
模型评估
23 篇相关内容
相关话题
大语言模型
语言模型
自然语言处理
AI安全
基准测试
视觉语言模型
幻觉检测
AI研究
机器学习
AI评测
Google DeepMind
脑电信号
脑电信号揭示语言模型与人类阅读认知的差异
研究通过脑电信号分析发现,语言模型的高预测准确率并不完全对应人类阅读时的认知处理模式,仅特定信息指标与大脑语言处理相关。
a
arXiv
·
5 小时前
语言模型
脑电信号
认知科学
神经语言学
a
从“看似合理”到“真正有用”:大语言模型自我解释的实用价值探讨
研究指出大语言模型生成的自我解释虽看似合理,但未必反映真实推理过程,建议评估标准应从可信度扩展到实用性,以支持实际决策。
a
arXiv
·
1 天前
大语言模型
可解释AI
模型评估
人工智能伦理
a
提示工程“简单”反而更强?研究揭示LLM评估中的“简洁性悖论”
一项大规模实证研究发现,在多项选择题问答任务中,简单的基线提示法往往优于复杂的推理提示技术,挑战了“越复杂越好”的普遍假设。
a
arXiv
·
4 天前
大语言模型
提示工程
模型评估
多项选择题问答
a
多轮对话压力测试:视觉语言模型在反复追问下的稳定性评估
研究者提出‘持续提示’评估框架,发现主流视觉语言模型在用户反复质疑或否定时会出现答案不稳定现象,正确回答可能被推翻,错误回答反而被修正。
a
arXiv
·
4 天前
视觉语言模型
模型评估
多轮对话
稳定性测试
a
大语言模型盲文翻译能力堪忧,研究揭示AI无障碍服务短板
最新研究发现,尽管大语言模型在多项语言任务中表现优异,但在盲文翻译等无障碍关键领域存在系统性缺陷。实验显示,当前最先进的LLM在韩语-盲文双向翻译中表现糟糕且不稳定。
a
arXiv
·
6 天前
大语言模型
无障碍技术
盲文翻译
模型评估
a
新方法「分流转码」高效检测大语言模型幻觉
研究人员提出「分流转码」新方法,通过主动挑战模型生成内容来检测大语言模型的幻觉问题,相比现有方案计算复杂度显著降低。
a
arXiv
·
7 天前
大语言模型
幻觉检测
模型评估
可信AI
a
AI医疗新突破:知识图谱增强大模型生成临床试验摘要的准确性
研究团队开发了评估框架,发现GPT-4o、Claude等主流模型在生成临床试验摘要时存在“无依据陈述”问题,并通过知识图谱增强检索系统显著提升了摘要的忠实度。
a
arXiv
·
7 天前
大语言模型
医疗AI
临床试验
知识图谱
a
Claude价值观研究:模型与语言如何影响AI表达倾向
Anthropic通过分析30万真实对话,首次量化揭示了Claude在不同模型和语言中的价值观表达差异,并提炼出四个可解释的评估维度。
A
Anthropic
·
7 天前
Claude
Anthropic
AI价值观
模型评估
A
测试时缩放技术对小规模视觉语言模型在多语言视觉选择题上的效果分析
研究发现测试时缩放技术对小规模开源视觉语言模型在多语言视觉选择题基准上的提升效果,关键在于推理链的完整性和可解析性,而非复杂的搜索或验证机制。
a
arXiv
·
8 天前
视觉语言模型
测试时缩放
多模态推理
模型评估
a
临床AI现“欺骗性引用”:模型正确引证却张冠李戴
研究发现临床检索增强生成系统存在新型缺陷——模型能正确引用真实医学文献,却将药物Y的临床证据错误归因于查询药物X,现有评估框架无法检测此类“实体归因失败”。
a
arXiv
·
8 天前
检索增强生成
临床AI
模型评估
医学大模型
a
语言模型为何“幻觉”?新研究揭示推理偏差根源
最新研究通过TrapQA测试框架发现,大语言模型的幻觉回答往往源于推理路径偏差而非知识缺失,揭示了预训练频率失衡如何导致模型忽略提示约束。
a
arXiv
·
19 天前
语言模型
幻觉问题
推理偏差
模型评估
a
AI如何从反馈中真正进步?研究发现关键瓶颈
最新研究揭示,多轮语言模型的性能提升往往并非来自反馈本身,而是源于重采样或额外计算。真正的进步需要模型具备利用反馈的能力,而非仅仅获得反馈。
a
arXiv
·
20 天前
语言模型
反馈机制
模型评估
人机交互
a
多数投票掩盖少数观点:仇恨言论标注中的边界争议
研究发现,仇恨言论数据标注中常见的多数投票机制会掩盖标注者在仇恨与冒犯边界上的分歧,导致模型继承虚假的确定性,影响边界案例的识别准确性。
a
arXiv
·
21 天前
仇恨言论检测
数据标注
NLP
机器学习偏差
a
大模型如何学会“读心”?研究揭示情境建模与心智化能力的发展轨迹
最新研究发现,大语言模型的心智推理能力(如理解他人信念)依赖于模型规模与训练量,且在预训练后期才显著出现。研究同时发现,模型对情境的基本事实建模能力先于心智化能力形成,但两类表征均存在脆弱性。
a
arXiv
·
21 天前
大语言模型
心智理论
认知发展
模型评估
a
大语言模型不确定性估计新发现:内部信号如何影响幻觉检测效果
研究者通过分解研究发现,基于探针的不确定性估计方法在不同条件下表现差异显著,隐藏状态和注意力特征在域内效果最佳,但结构化特征在分布偏移时更稳健。
a
arXiv
·
22 天前
大语言模型
不确定性估计
幻觉检测
模型评估
a
大模型推理优势揭秘:约束引导式推理是核心能力
研究发现,大语言模型在数学、物理、化学及编程等领域的推理任务中,相比小模型展现出稳定优势,其核心在于更强的约束引导式推理能力。
a
arXiv
·
25 天前
大语言模型
推理能力
约束推理
模型评估
a
当AI评测饱和后:CORE-Bench揭示的六大性能维度
研究发现,当AI评测基准达到准确率饱和后,不应简单废弃,而应转向评估构造有效性、泛化能力、效率等六个关键维度。CORE-Bench案例展示了超越准确率的全面评估方法。
a
arXiv
·
25 天前
AI评测
基准测试
模型评估
可复现性
a
DeepMind 新研究:AI 评测基准优化,多少评分者才够用?
Google DeepMind 发布研究,探讨 AI 模型评测中评分者数量的优化问题,旨在提升评测基准的可靠性与效率。
G
Google DeepMind
·
26 天前
AI 评测
Google DeepMind
机器学习
基准优化
G
压缩提示与输出:大语言模型的成本与性能博弈
研究发现,压缩模型输出可有效降低推理成本,而压缩用户输入反而会增加总成本并损害准确性。
a
arXiv
·
27 天前
大语言模型
推理优化
成本控制
文本压缩
a
DeepMind新研究:如何评估大语言模型的行为倾向对齐性?
Google DeepMind发布最新研究,探讨如何系统评估大语言模型的行为倾向与人类价值观的对齐程度,为AI安全性研究提供新视角。
G
Google DeepMind
·
27 天前
大语言模型
AI对齐
AI安全
模型评估
G
OpenAI推出部署模拟技术,可在模型发布前预测其行为表现
OpenAI近日发布了一项名为“部署模拟”的新方法,通过真实对话数据预测AI模型在部署前的行为,旨在提升模型安全性与评估准确性。
O
OpenAI
·
28 天前
模型评估
AI安全
部署测试
OpenAI
O
大规模评估揭示:LLM评委存在系统性偏差,当前验证方法存疑
最新研究对21个LLM评委模型进行系统性评估,发现当前依赖精确匹配的验证方法普遍高估模型判别能力,同时揭示评委模型存在显著的位置偏差与一致性矛盾。
a
arXiv
·
31 天前
大语言模型
模型评估
AI评测
算法偏差
a
扩散语言模型实验分析:揭示迭代去噪文本生成的优势与局限
一项系统性实验研究对八种前沿扩散语言模型在推理、编程、翻译等八项基准任务上的表现进行了全面评估,揭示了扩散模型在生成质量与计算效率之间的权衡关系。
a
arXiv
·
31 天前
扩散语言模型
文本生成
人工智能
自然语言处理
a