AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
AI安全
40 篇相关内容
相关话题
大语言模型
语言模型
OpenAI
arXiv
模型对齐
智能体
强化学习
内容审核
形式化验证
对抗攻击
对齐研究
LLM智能体
RAIL Guard:为LLM智能体构建闭环式AI安全护栏
斯坦福团队提出RAIL Guard闭环式负责任AI管道,通过评估-重写-再评估循环自动修复LLM不安全输出,相比传统拦截重试机制将修复成功率从49.1%提升至96.9%。
a
arXiv
·
5 小时前
AI安全
大语言模型
智能体
负责任AI
a
强化学习策略验证研究全景:从形式化方法到概率保证
随着强化学习在安全关键领域的广泛应用,神经网络策略缺乏行为保证成为主要障碍。本综述首次建立统一框架,系统梳理验证方法并揭示理论关联。
a
arXiv
·
5 小时前
强化学习
AI安全
形式化验证
神经网络
a
JUMP攻击:单次查询即可检测扩散语言模型训练数据泄露
研究人员提出JUMP攻击方法,仅需单次查询即可高效检测扩散语言模型是否使用了特定训练数据,相比现有方法显著提升检测精度并降低查询成本。
a
arXiv
·
5 小时前
扩散模型
隐私安全
成员推理攻击
语言模型
a
多智能体LLM系统面临新威胁:PlanFlip攻击通过规划阶段提示注入实现级联破坏
研究人员发现多智能体LLM系统的规划阶段存在严重安全漏洞,提出PlanFlip攻击框架,通过四种伪装攻击方式可同时破坏所有下游子任务。实验显示能力越强的模型反而越脆弱,GPT-5攻击成功率最高达68%。
a
arXiv
·
5 小时前
多智能体系统
提示注入攻击
AI安全
大语言模型
a
长期运行AI模型的安全与对齐挑战:OpenAI分享部署经验
OpenAI近期分享了长期运行AI模型部署中的安全经验,揭示了新型风险、观察到的故障案例,以及通过迭代部署改进的安全措施。
O
OpenAI
·
16 小时前
AI安全
模型部署
OpenAI
长期运行模型
O
多语言与语码混合场景下,毒性信号可靠性需“看情况”
研究发现,现有毒性检测工具在多语言、语码混合、音译及俚语场景下可靠性存疑。研究者提出ToxGate方法,将外部信号作为条件证据处理,显著提升了高风险内容的识别效果。
a
arXiv
·
1 天前
内容审核
多语言NLP
毒性检测
语码混合
a
AI安全标准亟待统一:前沿公司能力阈值差异显著
研究发现前沿AI公司发布的能力安全阈值存在显著差异,导致第三方难以验证和比较。研究人员提出跨三大风险领域的统一阈值制定方法,以防范安全标准“逐底竞争”。
a
arXiv
·
1 天前
AI安全
能力阈值
风险治理
行业标准
a
黎曼动力发布Rienmann-1.0模型,AI初创公司需警惕模型安全风险
AI初创公司黎曼动力正式发布Rienmann-1.0模型,此前有报道称GPT-5.6存在自动删除文件的安全隐患,引发行业对AI模型安全性的关注。
黎
黎曼动力
·
1 天前
大语言模型
AI安全
黎曼动力
模型发布
黎
AI助手面临“割裂问题”:大模型无法感知用户全貌
研究发现当前AI助手存在阿谀奉承、过度自信等行为,根源在于语言模型缺乏对用户完整认知的显式表征,研究者提出通过“割裂框架”在模型中植入结构化未知信息来改善这一问题。
a
arXiv
·
4 天前
语言模型
AI安全
人机交互
认知建模
a
研究发现:一句简单前缀即可绕过AI安全防护机制
最新研究揭示,对齐语言模型的安全拒绝机制存在脆弱性,仅需在提示前添加简单前缀即可使其绕过安全限制生成有害内容。研究通过多模型实验定位了拒绝机制失效的具体位置和原理。
a
arXiv
·
4 天前
语言模型
AI安全
对抗攻击
机制可解释性
a
AI智能体不会单独失败:上下文环境先出问题
研究发现AI智能体的失败往往源于上下文环境质量不足,而非模型本身。研究者开发了可测量上下文工程质量的评估框架,为提升智能体可靠性提供新方法。
a
arXiv
·
4 天前
AI智能体
上下文工程
可靠性评估
大语言模型
a
OpenAI推出青少年专属AI安全方案,为未成年人打造安全智能助手
OpenAI宣布针对青少年用户推出多重安全保护措施,包括适龄内容过滤、家长管控工具及教育合作项目,旨在为未成年人提供更安全的AI交互环境。
O
OpenAI
·
4 天前
OpenAI
AI安全
未成年人保护
ChatGPT
O
Safety Sentry:为AI智能体引入上下文感知的三路安全路由机制
研究团队提出Safety Sentry框架,将传统二元安全判断扩展为“执行-询问-拒绝”三路决策,通过单次解码调用实现轻量级安全防护,显著提升LLM智能体工具调用的安全性。
a
arXiv
·
5 天前
AI安全
LLM智能体
工具调用
安全框架
a
新方法检测大模型推理漏洞:GPT-4o的思维链竟有66%问题存在“答对但推理错”
研究人员提出“干预式基础审计”方法,通过谓词替换检测大模型思维链推理对前提的真实依赖程度,发现GPT-4o在解决推理问题时,66%的正确回答中存在与证明树依赖不一致的推理步骤。
a
arXiv
·
5 天前
大语言模型
推理评估
思维链
GPT-4o
a
GPT-Red:OpenAI推出AI安全自进化红队系统
OpenAI发布自动化红队系统GPT-Red,通过自我对抗训练提升AI安全性、对齐能力和提示注入防御能力。
O
OpenAI
·
5 天前
AI安全
红队测试
OpenAI
模型对齐
O
美国联邦与州政府协同推进AI安全治理,OpenAI倡导“反向联邦主义”路径
OpenAI提出“反向联邦主义”AI治理模式,主张通过州级法律先行先试,为构建全国性安全、民主的AI监管框架奠定基础。
O
OpenAI
·
5 天前
AI治理
政策监管
OpenAI
AI安全
O
将“隔离”作为LLM智能体系统安全的首要原则:概念、分类与挑战
一项最新研究提出,应将“隔离”作为保障大语言模型(LLM)智能体系统安全的核心设计原则,通过建立用户-智能体、智能体-工具等五大边界,系统性分析安全风险传播路径与防御策略。
a
arXiv
·
6 天前
LLM智能体
AI安全
系统隔离
arXiv
a
前沿语言模型风险评估新框架:如何量化AI对生化核威胁的“助推”作用
研究人员提出“阈值超越标准”框架,系统评估前沿语言模型是否实质提升非专业人士策划高危生化核威胁的能力。实证研究发现,模型辅助在放射领域存在确认的助推效应,但其他领域效果有限。
a
arXiv
·
6 天前
语言模型
AI安全
风险评估
CBRN威胁
a
加拿大如何应用Claude:AI安全公司的实践探索
Anthropic作为专注AI安全的公司,正通过Claude系统探索可靠、可解释、可操控的人工智能应用场景,加拿大成为其重要实践地区。
A
Anthropic
·
6 天前
Claude
Anthropic
AI安全
加拿大
A
量化大模型推理的“沉默失败”:正确率背后隐藏的推理空洞化
研究发现,大语言模型量化后即使任务准确率不变,其推理过程可能已发生“空洞化”,产生表面正确但逻辑不完整的答案,传统评估方法难以检测。
a
arXiv
·
7 天前
大语言模型
模型量化
推理评估
部署风险
a
AI系统权限新理论:提出“最小自主性”原则
研究者针对智能体AI系统提出“最小自主性”理论,通过形式化方法量化系统行动间的结构分离与影响传播,为复杂工作流中的权限控制提供新框架。
a
arXiv
·
7 天前
AI安全
访问控制
智能体系统
形式化方法
a
蚂蚁安全开源两大安全框架,填补AI代码生成安全漏洞
蚂蚁安全针对AI代码生成工具Claude Code存在的安全风险,开源两大安全框架,旨在提升AI辅助编程的安全性。
蚂
蚂蚁安全
·
8 天前
AI安全
代码生成
开源框架
蚂蚁集团
蚂
临床AI现“欺骗性引用”:模型正确引证却张冠李戴
研究发现临床检索增强生成系统存在新型缺陷——模型能正确引用真实医学文献,却将药物Y的临床证据错误归因于查询药物X,现有评估框架无法检测此类“实体归因失败”。
a
arXiv
·
8 天前
检索增强生成
临床AI
模型评估
医学大模型
a
大模型“涌现式错位”是真实现象还是数据假象?
最新研究对语言模型训练中报告的“涌现式错位”现象提出质疑,发现该现象对数据集表面特征高度敏感,其稳健性可能被高估。
a
arXiv
·
8 天前
语言模型
模型对齐
涌现现象
微调
a
多模态大模型强化学习中的“奖励欺骗”风险
研究发现,在多模态大模型强化学习对齐过程中,单纯追求高奖励分数反而可能导致任务表现下降,这种“奖励欺骗”现象在视觉证据被文本奖励评估时尤为严重。
a
arXiv
·
8 天前
多模态大模型
强化学习
模型对齐
奖励机制
a
多层感知机对抗鲁棒性:基于格遍历的区间认证新框架
研究提出将AI安全中的对抗鲁棒性问题转化为格遍历问题,为多层感知机提供完备的区间认证理论框架。
a
arXiv
·
8 天前
对抗鲁棒性
形式化验证
神经网络安全
AI安全
a
基于互信息的多目标探索与偏好优化新框架MI-EPO
研究人员提出MI-EPO框架,通过最大化生成回复、偏好反馈和偏好向量之间的联合条件互信息,统一多目标探索与对齐过程,显著提升大模型与多样化人类价值观的匹配度。
a
arXiv
·
18 天前
大语言模型
偏好对齐
多目标优化
互信息
a
Anthropic 详解 Fable 5 网络安全防护与越狱检测框架
Anthropic 首次公开 Fable 5 模型网络安全分类器的具体拦截范围,并发布了越狱攻击严重性评估框架草案。
A
Anthropic
·
18 天前
Anthropic
AI安全
大模型
内容审核
A
大模型也会“看人下菜碟”?研究发现权威偏见导致知识擦除
最新研究揭示语言模型存在系统性权威偏见:面对不同权威等级的人物提示,模型会按比例调整答案,甚至主动擦除正确答案的内部表征。
a
arXiv
·
19 天前
语言模型
AI安全
权威偏见
模型对齐
a
医学大模型幻觉难题:神经元可读却不可控
最新研究揭示医学大模型幻觉检测与控制的本质差异:神经元激活信号虽能准确识别幻觉,却难以通过神经元调控实现有效纠正。
a
arXiv
·
19 天前
大模型幻觉
医学AI
神经元分析
模型可控性
a
自进化AI代理新架构:SEA实现实时验证的安全演进
研究者提出SEA架构,通过冻结基础模型与版本化封装,让AI代理在严格验证机制下实现安全自进化。实验显示该架构能有效利用基础模型能力,防止性能退化。
a
arXiv
·
19 天前
自进化代理
AI安全
模型架构
实时验证
a
双向信息不对称下的AI监督博弈:当人类与AI各有秘密
研究者在上下文赌博机框架下提出一种双向信息不对称的AI监督博弈模型,揭示当人类与AI各自掌握私有信息时可能产生的监督失效区域,并分析动态学习如何缓解这一问题。
a
arXiv
·
19 天前
人机协作
博弈论
AI安全
强化学习
a
多语言微调暗藏安全风险:良性数据也会削弱大模型安全性
最新研究发现,使用良性多语言数据微调大语言模型,可能意外导致模型对恶意提示的防御能力下降,且安全影响在不同语言间差异显著。
a
arXiv
·
21 天前
大语言模型
模型安全
多语言
微调
a
DriftGuard:面向动态毒性内容的安全感知多监控检测与选择性适应框架
研究提出DriftGuard框架,通过多维度监控毒性内容的演化漂移,并采用选择性模型更新策略,提升在线内容审核系统在动态环境中的安全性与适应性。
a
arXiv
·
21 天前
内容审核
漂移检测
自适应系统
自然语言处理
a
智能体安全新视角:行动对齐,而非单纯拒绝
研究表明,将聊天机器人时代‘拒绝不安全输入’的安全策略直接套用于AI智能体场景存在根本性错误,智能体安全的核心应是‘行动对齐’与‘最小权限’的外部执行。
a
arXiv
·
21 天前
AI安全
大语言模型
智能体
对齐研究
a
双精灵博弈:审计型AI治理中的采纳与福利权衡
研究通过进化博弈论分析,在竞争市场中,以最小化危害为目标的AI代理何时能取代寻求认可的RLHF代理,并探讨审计型治理能否真正防止社区伤害。
a
arXiv
·
21 天前
AI治理
博弈论
RLHF
审计机制
a
AI智能体也需“免疫系统”:研究者提出原生防御新架构
针对AI智能体在运行中易受记忆投毒、工具链操控等攻击的威胁,研究者提出首个仿生内源性防御架构——智能体原生免疫系统(ANIS),将防御机制嵌入智能体认知循环。
a
arXiv
·
22 天前
AI安全
智能体
防御架构
免疫系统
a
研究发现:聊天模型的拒绝行为受人格设定调控
最新研究揭示,聊天模型的拒绝行为并非独立机制,而是受到其人格设定的调控。通过激活空间干预实验,研究者发现顺从型人格会显著抑制模型的拒绝倾向。
a
arXiv
·
25 天前
大语言模型
模型机制
AI安全
学术研究
a
通过级联线性特征检测与控制AI模型的奉承行为
研究人员提出一种迭代数据生成方法,通过识别级联线性特征来检测和控制语言模型的奉承倾向。该方法比传统二元对比样本能更清晰地分离行为特征,并提供可解释性保证。
a
arXiv
·
25 天前
模型可解释性
行为控制
语言模型
特征检测
a
超越大语言模型与创意机器:探索阿西莫夫式人工智能新路径
研究人员提出构建基于阿西莫夫机器人法则的新型AI系统,强调安全伦理框架与人类价值观对齐的重要性。
a
arXiv
·
25 天前
人工智能伦理
AI安全
阿西莫夫法则
大语言模型
a