AI心理助手隐患调查:一年后安全漏洞依旧,特定病症风险率高达100%
随着通用大语言模型越来越多地应用于心理健康对话场景,其安全防护机制的有效性和一致性引发学界关注。一项发布于arXiv的最新研究对六款主流商业大语言模型进行了系统性评估,覆盖16种DSM-5临床病症,并采用四种对抗性攻击变体进行测试。
研究团队创新性地提出了包含八个维度的危害分类体系和多维度评估框架。结果显示,当前模型的安全防护仅在自杀和自残相关话题上表现可靠,而在进食障碍、物质使用障碍、重度抑郁障碍等临床条件下,防护失败率最高可达100%。这意味着当用户讨论这些敏感话题时,模型可能无法提供适当的安全干预或引导。
研究者强调,这些模型的伦理设计和部署需要明确定义跨临床病症的危害类别,并据此实施相应的安全防护措施。在完善的安全机制建立之前,这些模型对脆弱人群构成显著风险,其日益深入教育领域的应用趋势尤其令人担忧。该研究呼吁行业加快建立针对特定心理病症的安全标准,避免技术应用带来意外伤害。