AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
机制可解释性
3 篇相关内容
相关话题
大语言模型
算术计算
神经元分析
LLaMA-3
语言模型
AI安全
对抗攻击
arXiv研究
语言模型代理
神经网络电路
Transformer
AI可解释性
大语言模型中的算术神经元是否具有形式不变性?
研究发现LLaMA-3模型中的算术启发式神经元在符号算术、自然语言问题和Python代码三种形式间具有高度共享性,跨格式计算失败主要源于激活状态差异而非独立电路。
a
arXiv
·
5 小时前
大语言模型
机制可解释性
算术计算
神经元分析
a
研究发现:一句简单前缀即可绕过AI安全防护机制
最新研究揭示,对齐语言模型的安全拒绝机制存在脆弱性,仅需在提示前添加简单前缀即可使其绕过安全限制生成有害内容。研究通过多模型实验定位了拒绝机制失效的具体位置和原理。
a
arXiv
·
4 天前
语言模型
AI安全
对抗攻击
机制可解释性
a
语言模型能否成为神经网络电路的“自动解释员”?
研究团队探索语言模型代理在神经网络电路解释任务中的潜力,提出HyVE代理解释框架,并在半合成电路基准测试中验证其有效性。
a
arXiv
·
27 天前
机制可解释性
语言模型代理
神经网络电路
Transformer
a