PASE框架:用神经符号世界模型验证LLM生成的云故障恢复计划
随着基于云的AI系统规模和复杂性持续增长,通过快速故障检测和自适应恢复确保服务可靠性已成为关键挑战。现有方法虽然整合了大型语言模型(LLM)进行语义理解和深度强化学习(DRL)进行策略优化,但通常采用顺序、松散耦合的架构,未能充分利用LLM的生成和推理能力。
研究团队提出PASE框架,这是一种规划感知的语义自愈引擎,将故障恢复重新概念化为神经符号程序合成任务。该框架采用LLM作为核心计划合成引擎,从语义原语库中生成结构化恢复计划。神经符号世界模型通过模拟验证计划可行性,而通过DRL训练的元提示优化器则学习生成最优提示来指导LLM的规划过程。
这种紧密的“推理-规划-验证-适应”循环支持动态、上下文感知的恢复策略生成,超越了预定义的动作空间。在真实世界云故障注入数据集上的实验表明,PASE显著优于现有方法,将平均系统恢复时间减少40%以上,并在未知故障场景中提高了故障检测准确率。该框架通过将基于LLM的推理与模型辅助验证和元学习指导相统一,推动了自主系统管理的发展。