AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
认知不确定性
2 篇相关内容
相关话题
大语言模型
评估基准
贝叶斯推理
多轮对话
临床数据
归因分析
模型校准
BayesBench:多轮证据累积下评估大语言模型信念轨迹的新基准
研究者提出BayesBench基准,首次系统评估大语言模型在多轮对话中能否像理性贝叶斯推理者那样更新信念。研究发现模型规模提升有助于潜在变量推断,但推断能力不一定能转化为理性的下游预测。
a
arXiv
·
20 天前
大语言模型
评估基准
贝叶斯推理
多轮对话
a
LLM的认知盲区:跨模型归因差异揭示结构化临床数据中的未知边界
研究通过跨模型归因差异分析发现,大语言模型在结构化临床数据任务中难以识别自身知识边界,其口头置信度与真实准确性脱节。
a
arXiv
·
31 天前
大语言模型
临床数据
认知不确定性
归因分析
a