AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
AI可解释性
3 篇相关内容
相关话题
语义框架
模型幻觉
知识验证
arXiv研究
机制可解释性
语言模型代理
神经网络电路
Transformer
Claude
Anthropic
逆向工程
人工智能安全
AI系统本质是语义抽象:新框架解析模型输出与事实的差距
研究者提出语义框架,区分AI系统输出的知识来源,为模型幻觉、引用不当等常见问题提供精确定义与检查方法。
a
arXiv
·
8 天前
AI可解释性
语义框架
模型幻觉
知识验证
a
语言模型能否成为神经网络电路的“自动解释员”?
研究团队探索语言模型代理在神经网络电路解释任务中的潜力,提出HyVE代理解释框架,并在半合成电路基准测试中验证其有效性。
a
arXiv
·
27 天前
机制可解释性
语言模型代理
神经网络电路
Transformer
a
科学家解码Claude AI思维,发现奇特内部机制
研究人员通过逆向工程窥探Claude AI的内部工作过程,揭示其决策逻辑中存在的非直观模式与潜在偏差。
A
Anthropic
·
31 天前
Claude
Anthropic
AI可解释性
逆向工程
A