新框架让AI心理支持更靠谱:TheraJudge评估器+TheraAgent多角色系统
大语言模型在心理健康支持领域展现出潜力,但如何确保其回答质量符合专业标准仍是挑战。最新研究提出创新框架,将治疗性回复生成转化为由多维、人类对齐评估驱动的决策优化问题。
该框架分为两个阶段:第一阶段推出开源评估器TheraJudge,通过对人工标注数据进行偏好优化训练,使其能在安全性、相关性、共情等7个心理维度提供可靠判断。实验显示,TheraJudge与临床医生评分的组内相关系数达0.87-0.95,超越监督基线模型和闭源评估器。
第二阶段引入TheraAgent多智能体系统,通过协调批评家、教练和治疗师三种专业角色,将TheraJudge的评估信号转化为针对性回复修订。盲测结果表明,该系统使人类评分的治疗质量提升0.43分(5分制),临床医生评分者间信度达96%。特别是对低质量回复(≤3分)改进达2.45分,94%的不安全输出得到修正。
研究团队指出,心理健康大模型的有效对齐关键在于基于人类对齐评估采取行动,而非单纯依赖更强的生成能力。该框架代码已在GitHub开源,为AI心理支持系统的安全部署提供新思路。