多语言微调暗藏安全风险:良性数据也会削弱大模型安全性

arXiv·21 天前

微调大语言模型是提升其下游任务性能的常用方法。然而,arXiv最新研究揭示,这种能力提升可能伴随着安全隐患:即使使用非对抗性的良性数据进行微调,也可能增加模型响应不安全提示的倾向。研究团队首次在多语言环境下对此现象进行了全面实证分析,使用九种语言翻译的良性数据微调了Llama-3.2、Qwen3和Gemma-3等模型。

研究发现,安全结果对微调语言和评估语言的选择高度敏感,在某些场景下,模型对对抗性提示的顺从率增加了四倍。多语言安全漂移与通用能力指标脱钩,且在不同语言和模型间呈现异质性。非英语语言的微调通常比英语引发更小的内部表征漂移,但这些细微变化却导致模型倾向于过度顺从或过度拒绝。

这意味着,仅基于英语评估微调影响,无法为实际部署提供足够的安全保障。为促进跨语言安全盲点的进一步研究,团队开源了Multilingual-Benign-Tune数据集和SORRY-Bench-Multilingual评估套件。该研究警示,多语言微调的安全影响复杂且难以预测,需更全面的跨语言安全评估框架。

大语言模型模型安全多语言微调AI安全

原文来源:https://arxiv.org/abs/2606.28843

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回