AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
模型可解释性
7 篇相关内容
相关话题
大语言模型
注意力机制
多模态AI
扩散语言模型
上下文学习
文本生成
Llama
逆向工程
AI研究
问答系统
基准数据集
AI公平性
双向诱导机制揭秘:掩码扩散语言模型如何实现上下文学习
最新研究揭示了扩散语言模型通过双向注意力机制实现上下文学习,其内部电路能同时利用前后文信息进行文本生成,与自回归模型形成鲜明对比。
a
arXiv
·
1 天前
扩散语言模型
上下文学习
注意力机制
模型可解释性
a
揭秘大语言模型的“倒计时”通用机制:同一子电路实现多任务计数
研究人员在Llama-3.1-70B-Instruct中发现了一个通用的“倒计时子电路”,该电路通过比较当前位置与目标长度来估计剩余时间,使模型能在多种任务中准确控制输出长度。
a
arXiv
·
6 天前
大语言模型
模型可解释性
Llama
逆向工程
a
无需训练!多模态文档问答证据溯源新方法,精度匹敌GPT-5.4
研究人员提出MultAttnAttrib方法,无需额外训练即可为多模态长文档问答系统生成精确证据溯源,同时发布首个专门评估多模态溯源的基准数据集。
a
arXiv
·
18 天前
多模态AI
问答系统
模型可解释性
注意力机制
a
大语言模型推理中的“演绎刻板印象”:当逻辑严谨遭遇社会偏见
研究发现大语言模型推理中存在“演绎刻板印象”现象,模型会将群体统计规律机械套用于个体案例,并提出Fair-GCG框架通过推理时注入特定短语有效缓解此类偏见。
a
arXiv
·
20 天前
大语言模型
AI公平性
推理偏见
伦理AI
a
手语模型能听懂“语音”吗?研究发现AI具备初步音系感知能力
最新研究揭示,手语识别模型展现出对抽象音系特征的敏感性,其中姿态模型擅长区分手形,像素模型更易捕捉位置变化,但现有训练范式仍受限于架构本身的归纳偏好。
a
arXiv
·
21 天前
手语识别
音系感知
多模态AI
模型可解释性
a
通过级联线性特征检测与控制AI模型的奉承行为
研究人员提出一种迭代数据生成方法,通过识别级联线性特征来检测和控制语言模型的奉承倾向。该方法比传统二元对比样本能更清晰地分离行为特征,并提供可解释性保证。
a
arXiv
·
25 天前
模型可解释性
行为控制
语言模型
特征检测
a
破解大模型越狱攻击新视角:中间层熵动态变化暗藏玄机
研究发现,大语言模型在遭遇越狱攻击时,其内部中间层的熵值动态变化会呈现特定模式,这为检测恶意意图提供了新线索。
a
arXiv
·
26 天前
大语言模型
安全对齐
越狱攻击
模型可解释性
a