NeFut Logo NeFut
EN 管理员登录

[AI学术] FigAct:将科学图表转化为可交互的解释画布

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

科学图表的本意是用视觉方式传递信息,但多数多模态大语言模型(MLLM)只能把图像内容转成文字解释,读者需要自行把文字对应回图中。为了解决这一痛点,本文提出 FigAct 框架:直接在原有图形元素上操作,将静态科学图表转化为 基于提问的可视化展示。FigAct 的工作流程类似人类演示者:

  1. 生成一系列简短的叙述句;
  2. 将每句叙述锚定到对应的视觉证据;
  3. 对图表元素施加视觉动作(如高亮、放大、遮盖),引导观众注意力。

为高效定位图形元素,FigAct 采用层次化搜索策略,使 token 消耗约降低 40\times。模型规模为 FigAct‑8B,训练时引入三类任务专用奖励:

此外,作者构建了一个 人工验证基准,收集真实论文中的图表并评估 MLLM 的可视化解释能力。实验结果表明,FigAct 能显著提升解释的清晰度和可追溯性,验证了将科学图表视作演示画布的有效性。

点评: FigAct 通过“说—看—指”三步闭环,将文字解释与图形交互紧密结合,为科研阅读提供了更直观、易于跟随的解释方式。

原文链接: https://arxiv.org/abs/2609.36190

[h] 返回首页