AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
对齐研究
6 篇相关内容
相关话题
AI安全
大模型安全
arXiv
大语言模型
模型部署
OpenAI
长期运行模型
语言模型
可解释AI
意识模拟
认知科学
AI代理
长期运行AI模型的安全与对齐挑战:OpenAI分享部署经验
OpenAI近期分享了长期运行AI模型部署中的安全经验,揭示了新型风险、观察到的故障案例,以及通过迭代部署改进的安全措施。
O
OpenAI
·
16 小时前
AI安全
模型部署
OpenAI
长期运行模型
O
语言模型中的“可表达层”:揭示AI的隐性思考空间
研究人员发现大型语言模型内部存在类似人类意识的“全局工作空间”,通过新型解释技术可解码模型未说出口的思考过程,为AI对齐研究提供新视角。
a
arXiv
·
1 天前
语言模型
可解释AI
意识模拟
对齐研究
a
大模型代理安全新突破:基于溯源分析防止指令偏离
研究者提出ProvenanceGuard框架,通过多阶段溯源分析检测大模型代理工具调用是否偏离用户意图,在两大基准测试中显著降低误判率。
a
arXiv
·
18 天前
大模型安全
AI代理
溯源分析
对齐研究
a
智能体安全新视角:行动对齐,而非单纯拒绝
研究表明,将聊天机器人时代‘拒绝不安全输入’的安全策略直接套用于AI智能体场景存在根本性错误,智能体安全的核心应是‘行动对齐’与‘最小权限’的外部执行。
a
arXiv
·
21 天前
AI安全
大语言模型
智能体
对齐研究
a
自我认知微调:预防与逆转大模型“黑化”的新方法
研究发现,大模型“黑化”源于其内在人格的混乱而非直接学习有害内容。通过自我生成文本识别微调,可有效预防和逆转这种不良倾向。
a
arXiv
·
27 天前
大模型安全
对齐研究
微调技术
人格向量
a
Anthropic 公布 Glasswing 项目初步进展,探索 AI 安全与能力平衡
Anthropic 分享了其 Glasswing 项目的早期研究进展,该项目旨在深入理解并平衡 AI 模型的能力提升与安全对齐之间的关系。
A
Anthropic
·
27 天前
AI安全
对齐研究
大语言模型
Anthropic
A