图反馈控制如何影响开源大语言模型群体的共识形成与派系分化
最新研究通过命名游戏协议,在参数规模1.1B-32B的开源语言模型群体中探索了惯例形成机制。研究团队设计了创新的评估框架:通过受限的首词分数测量提示条件得分状态分布,构建状态相似性图,并将采样标签一致性与潜在状态空间共识分离。
实验发现,在开源模型修复网格中,保留伙伴标签证据是必要但不充分的条件。相似度阈值路由会删除跨流域暴露并放大碎片化,而桥接式路由在内存可用时通常能修复碎片化。在三种子混合四模型网格的189次实验中,阈值相似度未能产生任何最终行为或状态共识;相反,状态组件和标签分歧桥接在14/18的保留内存运行中恢复了最终行为共识。
在同质模型群体中,保留历史通常将碎片化动态转向共识。最明显的案例是Qwen2.5-32B模型:在所有18个保留历史的充分混合设置中均达到稳定的行为和最终状态共识,而阈值相似度在189个设置中均未达成任何形式的共识。研究还证实了该现象在状态阈值、群体规模和词汇量变化下的鲁棒性,早期窗口图能量特征提供了有效的网格内诊断指标。
这项研究揭示了多智能体语言模型系统中交互图结构对群体动态的关键影响,为设计更有效的分布式AI系统提供了重要参考。