新框架让AI心理支持更靠谱:TheraJudge评估器+TheraAgent多角色系统

arXiv·20 天前

大语言模型在心理健康支持领域展现出潜力,但如何确保其回答质量符合专业标准仍是挑战。最新研究提出创新框架,将治疗性回复生成转化为由多维、人类对齐评估驱动的决策优化问题。

该框架分为两个阶段:第一阶段推出开源评估器TheraJudge,通过对人工标注数据进行偏好优化训练,使其能在安全性、相关性、共情等7个心理维度提供可靠判断。实验显示,TheraJudge与临床医生评分的组内相关系数达0.87-0.95,超越监督基线模型和闭源评估器。

第二阶段引入TheraAgent多智能体系统,通过协调批评家、教练和治疗师三种专业角色,将TheraJudge的评估信号转化为针对性回复修订。盲测结果表明,该系统使人类评分的治疗质量提升0.43分(5分制),临床医生评分者间信度达96%。特别是对低质量回复(≤3分)改进达2.45分,94%的不安全输出得到修正。

研究团队指出,心理健康大模型的有效对齐关键在于基于人类对齐评估采取行动,而非单纯依赖更强的生成能力。该框架代码已在GitHub开源,为AI心理支持系统的安全部署提供新思路。

心理健康AI大语言模型对齐多智能体系统评估框架开源工具

原文来源:https://arxiv.org/abs/2606.30887

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回