AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
微调方法
1 篇相关内容
相关话题
大语言模型
安全对齐
对抗攻击
arXiv研究
HARC新方法:耦合有害性与拒绝方向,提升大模型安全对齐鲁棒性
研究者提出HARC微调方法,通过耦合提示端与响应端的有害性与拒绝方向,在保持模型通用能力的同时显著提升对抗攻击的防御能力。该方法在五大模型家族上验证有效,无需架构特定调整。
a
arXiv
·
19 天前
大语言模型
安全对齐
对抗攻击
微调方法
a