SheepNav
精选今天0 投票

SCAFFOLD:大规模计算机科学论文图表理解数据集,助力视觉语言模型

计算机科学论文中充满了图表:架构图、系统流程图、流水线示意图等,这些图表往往比周围的文本承载了更多信息。然而,目前尚缺乏一个公开数据集,能够将这些特定类型的图表与标题、上下文、问题、答案及逐步推理过程配对,而这正是训练视觉语言模型理解它们所必需的。为此,研究者提出了 SCAFFOLD,一个大规模的结构化数据集,用于计算机科学研究图表的问答与思维链推理。

数据集构成

SCAFFOLD 数据集包含(图像、标题、上下文、问题-答案、思维链)元组,这些元组来自 arXiv 上的计算机科学论文,通过布局检测和 PDF 解析生成,并辅以 AI 辅助的问题生成步骤。该数据集提供三个规模版本:

  • SCAFFOLD-157K:大规模版本,涵盖 3,058 篇论文29,887 个图表,共 157,387 对数据。
  • SCAFFOLD-37K:中等规模,包含 36,797 对数据。
  • SCAFFOLD-12K:小规模,包含 12,000 对数据。

基线实验

研究团队使用 SCAFFOLD-12K 对 Qwen2.5-VL-3B-Instruct 模型进行了基线实验,验证了数据集在训练视觉语言模型理解论文图表方面的有效性。

背景与意义

在人工智能领域,视觉语言模型(如 GPT-4V、Qwen-VL)已经展现出强大的图文理解能力,但它们在理解专业学术图表方面仍存在不足。SCAFFOLD 数据集的发布填补了这一空白,为研究者提供了丰富的训练资源,有望提升模型在学术文献理解、科学发现等应用中的表现。此外,数据集的思维链推理注释有助于模型学习如何逐步分析图表,提高推理的可解释性和准确性。

展望

尽管 SCAFFOLD 数据集主要聚焦于计算机科学论文,但其方法可以扩展到其他科学领域,如医学、物理等,为更广泛的科学图表理解提供支持。未来,研究者可以基于此数据集开发更强大的模型,并探索多模态推理的更多可能性。

延伸阅读

  1. UI-Venus-2:跨越移动、网页与桌面的通用GUI智能体
  2. OpenAgentFlow:为异构AI智能体舰队构建全系统安全边界
  3. LLM长程状态追踪能力新测试:通过196次工具调用执行MD5哈希
查看原文