COMPASS框架:统一多模态模型实现构图意图感知与生成控制
构图作为高阶视觉意图,控制着场景中主体的位置与组织方式,但现有统一多模态模型在细粒度构图识别上仍不可靠,也难以将此类意图转化为可控生成。为此,研究团队提出COMPASS框架,这是首个在单一系统中同时实现构图感知与构图引导生成的统一多模态框架。该框架以共享专家令牌τc为核心意图锚点:在感知侧,COMPASS以最小侵入方式将构图专业知识注入混合专家主干网络,并将推断出的意图蒸馏至τc;在生成侧,τc被复用为全局条件信号,引导去噪轨迹,从而将被动构图分析转化为显式的布局控制。为支持大规模系统化构图学习与评估,团队构建了Comp-11数据集,包含11类构图分类及推理增强标注。实验表明,COMPASS显著提升了类别级构图理解能力,并相比基线模型实现了更构图一致、提示忠实的生成效果。