AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
内容审核
6 篇相关内容
相关话题
AI安全
自然语言处理
社交媒体分析
多语言AI
多语言NLP
毒性检测
语码混合
多语言模型
AI研究
Anthropic
大模型
越狱攻击
多语言与语码混合场景下,毒性信号可靠性需“看情况”
研究发现,现有毒性检测工具在多语言、语码混合、音译及俚语场景下可靠性存疑。研究者提出ToxGate方法,将外部信号作为条件证据处理,显著提升了高风险内容的识别效果。
a
arXiv
·
1 天前
内容审核
多语言NLP
毒性检测
语码混合
a
混合模型策略:AfroXLMR-Social与DeBERTa在极化内容检测中的协同应用
研究人员提出一种混合建模方法,结合DeBERTa和AfroXLMR-Social模型,针对英语和豪萨语中的极化言论进行检测与分类,在资源受限环境下取得竞争性结果。
a
arXiv
·
7 天前
自然语言处理
社交媒体分析
多语言模型
内容审核
a
Anthropic 详解 Fable 5 网络安全防护与越狱检测框架
Anthropic 首次公开 Fable 5 模型网络安全分类器的具体拦截范围,并发布了越狱攻击严重性评估框架草案。
A
Anthropic
·
18 天前
Anthropic
AI安全
大模型
内容审核
A
Transformer模型新突破:多语言极化内容检测准确率提升
研究人员提出基于Transformer的极化检测方法,通过类别权重和阈值调优技术,在英语和斯瓦希里语的多标签分类任务中取得显著效果。
a
arXiv
·
20 天前
自然语言处理
Transformer模型
内容审核
多语言AI
a
DriftGuard:面向动态毒性内容的安全感知多监控检测与选择性适应框架
研究提出DriftGuard框架,通过多维度监控毒性内容的演化漂移,并采用选择性模型更新策略,提升在线内容审核系统在动态环境中的安全性与适应性。
a
arXiv
·
21 天前
内容审核
漂移检测
自适应系统
自然语言处理
a
通义千问推出Qwen3Guard:首个实时AI安全护栏模型
通义千问发布首个安全护栏模型Qwen3Guard,基于Qwen3基础模型微调,可实时检测提示与回复的安全性,支持多语言环境。
通
通义千问 Qwen
·
28 天前
通义千问
AI安全
大语言模型
内容审核
通