科学图表的本意是用视觉方式传递信息,但多数多模态大语言模型(MLLM)只能把图像内容转成文字解释,读者需要自行把文字对应回图中。为了解决这一痛点,本文提出 FigAct 框架:直接在原有图形元素上操作,将静态科学图表转化为 基于提问的可视化展示。FigAct 的工作流程类似人类演示者:
- 生成一系列简短的叙述句;
- 将每句叙述锚定到对应的视觉证据;
- 对图表元素施加视觉动作(如高亮、放大、遮盖),引导观众注意力。
为高效定位图形元素,FigAct 采用层次化搜索策略,使 token 消耗约降低 40\times。模型规模为 FigAct‑8B,训练时引入三类任务专用奖励:
- 锚定准确度(确保叙述与视觉证据匹配);
- 搜索效率(鼓励快速定位);
- 渲染质量(保证视觉动作自然、易读)。
此外,作者构建了一个 人工验证基准,收集真实论文中的图表并评估 MLLM 的可视化解释能力。实验结果表明,FigAct 能显著提升解释的清晰度和可追溯性,验证了将科学图表视作演示画布的有效性。
点评: FigAct 通过“说—看—指”三步闭环,将文字解释与图形交互紧密结合,为科研阅读提供了更直观、易于跟随的解释方式。