AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
幻觉检测
5 篇相关内容
相关话题
大语言模型
模型评估
可信AI
自然语言处理
RAG
不确定性估计
机器学习
医疗AI
基准测试
多模态模型
过程评估
知识图谱
新方法「分流转码」高效检测大语言模型幻觉
研究人员提出「分流转码」新方法,通过主动挑战模型生成内容来检测大语言模型的幻觉问题,相比现有方案计算复杂度显著降低。
a
arXiv
·
7 天前
大语言模型
幻觉检测
模型评估
可信AI
a
CORTEX:基于内部表征对比的RAG幻觉检测新方法
研究人员提出CORTEX方法,通过对比大模型在有/无检索文档时的内部表征,实现细粒度的token级幻觉检测,在多个基准测试中表现优异。
a
arXiv
·
20 天前
RAG
幻觉检测
大语言模型
可信AI
a
大语言模型不确定性估计新发现:内部信号如何影响幻觉检测效果
研究者通过分解研究发现,基于探针的不确定性估计方法在不同条件下表现差异显著,隐藏状态和注意力特征在域内效果最佳,但结构化特征在分布偏移时更稳健。
a
arXiv
·
22 天前
大语言模型
不确定性估计
幻觉检测
模型评估
a
医疗AI评估新突破:MedBench v5引入动态过程导向与幻觉监测
研究者推出MedBench v5临床多模态模型基准测试,从静态问答转向动态过程评估,首次整合幻觉传播监测与可控压力测试,揭示模型任务表现与过程稳定性之间的关键差异。
a
arXiv
·
27 天前
医疗AI
基准测试
多模态模型
幻觉检测
a
LUCID:首个检测大语言模型知识图谱推理幻觉的新方法
研究者提出LUCID方法,首次针对大语言模型知识图谱推理框架中的幻觉问题,通过联合利用注意力分数、语义信息和图结构进行检测,在九个数据集上超越15个基线模型。
a
arXiv
·
31 天前
大语言模型
知识图谱
幻觉检测
推理框架
a