SCAFFOLD数据集发布:首个计算机科学论文图表理解基准
计算机科学论文中的图表(如架构图、流程图、管道示意图)往往比周围文字包含更丰富的信息,但目前缺乏专门针对这类学术图表的公开数据集。为解决这一问题,研究团队发布了SCAFFOLD数据集,这是首个大规模结构化计算机科学研究图表数据集,集成了图表问答和思维链推理轨迹。
该数据集通过布局检测和PDF解析技术,从arXiv计算机科学论文中提取图像、标题、上下文、问答对以及逐步推理过程,并采用AI辅助的问题生成步骤。最终构建了三个规模版本:大型SCAFFOLD-157K包含157,387个数据对(来自3,058篇论文的29,887张图表),中型SCAFFOLD-37K含36,797对,小型SCAFFOLD-12K含12,000对。研究团队已在Qwen2.5-VL-3B-Instruct模型上使用SCAFFOLD-12K进行了基线实验。
SCAFFOLD填补了学术图表理解训练数据的空白,为开发能够深度理解专业科学图表的视觉语言模型提供了关键资源,有望推动AI在学术文献分析和科学发现支持方面的发展。