首个建筑图纸多模态推理基准发布,大模型表现与专家差距显著
近日,研究团队在arXiv发布了首个专门评估多模态大语言模型在真实世界建筑图纸上表现能力的基准测试DrawingVQA。建筑图纸作为建筑、土木等工程实践的核心媒介,融合了几何图形、符号标记、表格数据、注释和领域特定文本,构成了工程工作流中特有的复杂视觉-文本领域。
该基准包含33份“已发布施工”图纸和92个由专家精心设计的问答对,涵盖三个推理深度:感知理解、上下文解释和领域专家推理。研究团队还提出了双分类框架,从七个建筑工程维度和四个MLLM能力维度联合分析模型性能,首次将工程工作流与AI推理能力进行显式映射。
对当前先进多模态大语言模型的评估结果显示,模型表现与专家水平存在显著差距,特别是在更高层次的推理任务上。这一基准为领域专业化多模态推理奠定了基础,有助于推动AI驱动的理解能力与真实世界工程工作流的融合。研究团队表示,DrawingVQA填补了现有评测体系在工程图纸理解方面的空白,为开发更实用的工程AI工具提供了重要参考。