AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
大模型安全
6 篇相关内容
相关话题
对齐研究
arXiv
AI对齐
Anthropic
Claude
文本检测
对抗性攻击
T5模型
对比学习
AI代理
溯源分析
可扩展监督
T5-CSBoost:对抗性扰动下的LLM文本指纹识别新突破
研究人员提出T5-CSBoost方法,通过对比学习增强文本风格表征的鲁棒性,在保持轻量级架构的同时显著提升对抗性扰动下的AI文本检测准确率。
a
arXiv
·
3 天前
文本检测
对抗性攻击
大模型安全
T5模型
a
大模型代理安全新突破:基于溯源分析防止指令偏离
研究者提出ProvenanceGuard框架,通过多阶段溯源分析检测大模型代理工具调用是否偏离用户意图,在两大基准测试中显著降低误判率。
a
arXiv
·
17 天前
大模型安全
AI代理
溯源分析
对齐研究
a
大模型“测谎”监督新突破:SOLiD方法展现良好扩展性
研究人员将SOLiD测谎监督方法扩展至更大规模模型,发现模型欺骗率随规模增大而显著下降,但该方法对数据分布变化较为敏感。
a
arXiv
·
17 天前
大模型安全
可扩展监督
偏好学习
模型欺骗检测
a
Anthropic重启Claude Fable 5部署,强化网络安全防护
Anthropic宣布自7月1日起重新部署Claude Fable 5模型,此次更新包含增强的网络安全防护措施和全新的行业级越狱防护框架。
A
Anthropic
·
19 天前
Anthropic
Claude
大模型安全
AI部署
A
自我认知微调:预防与逆转大模型“黑化”的新方法
研究发现,大模型“黑化”源于其内在人格的混乱而非直接学习有害内容。通过自我生成文本识别微调,可有效预防和逆转这种不良倾向。
a
arXiv
·
26 天前
大模型安全
对齐研究
微调技术
人格向量
a
Anthropic发布新研究:如何减少AI代理行为中的“目标错位”问题
Anthropic发布最新研究成果,探讨了在训练AI助手Claude过程中,如何有效减少“代理行为错位”这一核心挑战,旨在提升AI与人类意图的一致性。
A
Anthropic
·
27 天前
AI对齐
Anthropic
Claude
大模型安全
A