AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
推理评估
3 篇相关内容
相关话题
大语言模型
AI安全
思维链
GPT-4o
模型量化
部署风险
多智能体系统
法律AI
辩论框架
arXiv
新方法检测大模型推理漏洞:GPT-4o的思维链竟有66%问题存在“答对但推理错”
研究人员提出“干预式基础审计”方法,通过谓词替换检测大模型思维链推理对前提的真实依赖程度,发现GPT-4o在解决推理问题时,66%的正确回答中存在与证明树依赖不一致的推理步骤。
a
arXiv
·
5 天前
大语言模型
推理评估
思维链
GPT-4o
a
量化大模型推理的“沉默失败”:正确率背后隐藏的推理空洞化
研究发现,大语言模型量化后即使任务准确率不变,其推理过程可能已发生“空洞化”,产生表面正确但逻辑不完整的答案,传统评估方法难以检测。
a
arXiv
·
7 天前
大语言模型
模型量化
推理评估
部署风险
a
法律推理新突破:多智能体辩论框架L-MAD系统评估
研究团队提出L-MAD框架,系统评估多智能体辩论在法律推理中的表现,发现合理配置智能体数量可提升准确性,但过度讨论会导致错误强化。
a
arXiv
·
8 天前
多智能体系统
法律AI
辩论框架
arXiv
a