OpenRCA数据集挑战:AI如何突破微服务故障根因分析的瓶颈?
在复杂的微服务生产环境中,故障根因分析需要处理跨指标、日志和追踪的大规模多模态遥测数据,这一难题对传统方法和基于大语言模型的方案都构成了严峻挑战。OpenRCA数据集集中体现了这些困难:规模庞大、模态多样且缺乏详细领域知识,导致现有所有方法的准确率持续偏低。
研究表明,经典的因果发现方法和现有基于大语言模型的多智能体系统在此基准测试中均无法可靠识别根本原因。为此,研究团队提出了结构化多智能体RCA流程,该方案在领域知识模式和知识无关模式下均显著优于现有基于大语言模型的方法及传统基线。
为深入诊断故障来源,团队引入了逆向推理智能体:在已知正确答案的情况下,该智能体能识别提取出的异常信号中哪些支持该结论,并判断第一阶段是否已获取这些信号,从而将每次失败归类为“推理缺口”(证据存在但未被利用)或“数据模糊性”(证据确实缺失)。分析显示,绝大多数故障案例中所需证据其实都已存在——瓶颈并非数据获取,而是智能体正确推理这些数据的能力。
研究进一步提出了自动化规则挖掘流程,能够系统地从逆向推理报告中提取判别规则,减少对人工知识整理的依赖。在所有配置中,模型推理能力和领域知识是主要制约因素:更强模型隐含更多领域专业知识,而显式知识注入能部分弥补这一差距。即使证据提取完美无缺,推理性能仍存在实际上限——仅靠架构工程和优化数据管道无法突破这一局限,必须在模型层面实现根本性提升。