SCAFFOLD数据集发布:首个计算机科学论文图表理解基准

arXiv·1 天前

计算机科学论文中的图表(如架构图、流程图、管道示意图)往往比周围文字包含更丰富的信息,但目前缺乏专门针对这类学术图表的公开数据集。为解决这一问题,研究团队发布了SCAFFOLD数据集,这是首个大规模结构化计算机科学研究图表数据集,集成了图表问答和思维链推理轨迹。

该数据集通过布局检测和PDF解析技术,从arXiv计算机科学论文中提取图像、标题、上下文、问答对以及逐步推理过程,并采用AI辅助的问题生成步骤。最终构建了三个规模版本:大型SCAFFOLD-157K包含157,387个数据对(来自3,058篇论文的29,887张图表),中型SCAFFOLD-37K含36,797对,小型SCAFFOLD-12K含12,000对。研究团队已在Qwen2.5-VL-3B-Instruct模型上使用SCAFFOLD-12K进行了基线实验。

SCAFFOLD填补了学术图表理解训练数据的空白,为开发能够深度理解专业科学图表的视觉语言模型提供了关键资源,有望推动AI在学术文献分析和科学发现支持方面的发展。

数据集图表理解视觉语言模型学术AI计算机科学

原文来源:https://arxiv.org/abs/2609.00018

相关阅读

AI智能体如何重塑人类群体的共识形成机制
text2ql框架革新数据库自然语言查询:支持多目标、零LLM模式实现100%执行准确率
无需预设长度!PILL方法显著提升扩散语言模型填充效率
新方法实现大模型知识编辑的精准逆转:只删恶意不改良性
无需训练!IDEEA实现输入依赖的激活匹配引导

← 返回