COMPASS框架:统一多模态模型实现构图意图感知与生成控制

arXiv·21 天前

构图作为高阶视觉意图,控制着场景中主体的位置与组织方式,但现有统一多模态模型在细粒度构图识别上仍不可靠,也难以将此类意图转化为可控生成。为此,研究团队提出COMPASS框架,这是首个在单一系统中同时实现构图感知与构图引导生成的统一多模态框架。该框架以共享专家令牌τc为核心意图锚点:在感知侧,COMPASS以最小侵入方式将构图专业知识注入混合专家主干网络,并将推断出的意图蒸馏至τc;在生成侧,τc被复用为全局条件信号,引导去噪轨迹,从而将被动构图分析转化为显式的布局控制。为支持大规模系统化构图学习与评估,团队构建了Comp-11数据集,包含11类构图分类及推理增强标注。实验表明,COMPASS显著提升了类别级构图理解能力,并相比基线模型实现了更构图一致、提示忠实的生成效果。

多模态模型可控生成构图理解人工智能框架计算机视觉

原文来源:https://arxiv.org/abs/2606.28696

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回