AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
注意力机制
8 篇相关内容
相关话题
大语言模型
上下文学习
模型可解释性
AI控制
通用算法
动态系统
强化学习
KV缓存压缩
推理优化
arXiv研究
扩散语言模型
文本生成
通用AI控制器问世:单一算法可驾驭25种动态系统
研究人员提出通用控制器算法,通过注意力机制与掩码技术,让单个神经网络无需结构调整即可控制不同维度的动态系统,在314,630组演示数据中展现出与专用控制器相当的性能。
a
arXiv
·
5 小时前
AI控制
通用算法
动态系统
注意力机制
a
SelKV:选择性KV缓存合并新框架,兼顾效率与精度
研究人员提出一种无需训练的双组件KV缓存压缩框架,通过软余弦门控选择性合并相似token,并引入注意力比例补偿机制,在保留25%缓存的情况下实现近无损生成质量。
a
arXiv
·
5 小时前
大语言模型
KV缓存压缩
注意力机制
推理优化
a
双向诱导机制揭秘:掩码扩散语言模型如何实现上下文学习
最新研究揭示了扩散语言模型通过双向注意力机制实现上下文学习,其内部电路能同时利用前后文信息进行文本生成,与自回归模型形成鲜明对比。
a
arXiv
·
1 天前
扩散语言模型
上下文学习
注意力机制
模型可解释性
a
语言模型能否胜任百万级文档检索?注意力稀释成关键挑战
研究首次系统探索语言模型在百万令牌规模下的上下文检索能力,提出BlockSearch模型并通过注意力机制改进,在多项基准测试中媲美甚至超越传统检索方法。
a
arXiv
·
18 天前
语言模型
信息检索
注意力机制
上下文学习
a
无需训练!多模态文档问答证据溯源新方法,精度匹敌GPT-5.4
研究人员提出MultAttnAttrib方法,无需额外训练即可为多模态长文档问答系统生成精确证据溯源,同时发布首个专门评估多模态溯源的基准数据集。
a
arXiv
·
18 天前
多模态AI
问答系统
模型可解释性
注意力机制
a
大语言模型新发现:句子级上下文同化现象
研究发现大语言模型存在句子级上下文同化现象,即提示中的句子会显著提升自身在推理时的生成概率,且该现象可通过调控少数注意力头进行抑制。
a
arXiv
·
27 天前
大语言模型
注意力机制
arXiv
模型行为分析
a
月之暗面开源FlashKDA:基于CUTLASS的高性能Delta Attention内核
月之暗面宣布开源FlashKDA,这是其基于CUTLASS的高性能Kimi Delta Attention内核实现,在H20平台上相比flash-linear-attention基线实现了1.72倍至2.22倍的预填充速度提升。
月
月之暗面 Kimi
·
27 天前
月之暗面
注意力机制
开源
性能优化
月
因果归因剪枝法:精准保留大语言模型推理能力的新策略
研究者提出基于因果归因的剪枝方法CAP,通过评估注意力头对推理任务的实际贡献进行精细权重剪枝,在保持模型性能的同时显著降低计算成本。
a
arXiv
·
31 天前
模型压缩
因果推理
注意力机制
大语言模型
a