AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
推理能力
9 篇相关内容
相关话题
大语言模型
arXiv
模型架构
基准测试
AI研究
扩散大语言模型
模型蒸馏
计算效率
Transformer
MoE
GPT
AI决策
无需强化学习!新方法让扩散大语言模型推理能力飙升
研究人员提出轨迹对齐蒸馏方法,通过监督模型自身去噪轨迹,显著提升扩散大语言模型的数学推理能力,计算效率提升近百倍。
a
arXiv
·
5 小时前
扩散大语言模型
模型蒸馏
推理能力
arXiv
a
Loopie:迄今最强循环Transformer模型,IMO/IPhO金牌表现无需工具
研究者提出Loopie系列模型,通过创新的循环Transformer架构与专家混合设计,在同等计算预算下显著超越传统Transformer基线,并在国际数学与物理奥赛中展现金牌级推理能力。
a
arXiv
·
1 天前
Transformer
MoE
模型架构
推理能力
a
思维脚手架如何影响AI决策?GPT架构差异导致干预效果相反
最新研究发现,结构化思维干预对大型语言模型战略推理能力的影响高度依赖模型架构,GPT标准版与推理优化版对同一干预措施呈现相反反应。
a
arXiv
·
7 天前
大语言模型
推理能力
GPT
AI决策
a
自引导测试时训练:提升大模型长文本理解能力的新方法
研究人员提出自引导测试时训练方法,通过智能筛选关键证据片段进行参数微调,显著提升大模型在长文本任务中的推理准确率。
a
arXiv
·
8 天前
大语言模型
长文本处理
测试时训练
模型优化
a
ISOSCI基准:揭秘大模型推理能力与知识检索的真实关系
研究团队推出ISOSCI基准测试,通过同构跨学科科学问题对分离大模型的推理能力与领域知识检索,发现当前推理模式提升主要依赖知识而非纯逻辑结构。
a
arXiv
·
18 天前
基准测试
大模型评估
推理能力
知识检索
a
AGI Maze:世界建模智能体新基准,LLM 推理能力面临挑战
研究者提出 AGI Maze 基准框架,用于评估智能体在部分可观测环境中的世界建模能力,实验显示当前 LLM 难以在推理时内部表示迷宫状态,即使借助记忆机制仍无法可靠解决简单任务。
a
arXiv
·
19 天前
基准测试
世界建模
大语言模型
推理能力
a
大模型思维表征四大公理:揭示基准测试掩盖的深层缺陷
研究者提出评估大模型潜在思维表征的四大公理框架,发现当前模型均无法同时满足所有公理要求,揭示基准测试精度掩盖的表征缺陷。
a
arXiv
·
22 天前
大语言模型
思维表征
评估框架
推理能力
a
大模型推理优势揭秘:约束引导式推理是核心能力
研究发现,大语言模型在数学、物理、化学及编程等领域的推理任务中,相比小模型展现出稳定优势,其核心在于更强的约束引导式推理能力。
a
arXiv
·
25 天前
大语言模型
推理能力
约束推理
模型评估
a
语言模型的社会推理能力从何而来?训练数据溯源揭示能力起源
研究人员通过训练数据溯源技术,首次系统揭示了语言模型中社会推理与STEM推理能力的不同数据来源,发现两者依赖完全不同的语料库区域。
a
arXiv
·
31 天前
语言模型
训练数据
推理能力
可解释AI
a