摘要
表格问答(TableQA)旨在对表格进行推理以回答用户查询。现有研究将所有问题视为统一,且仅通过整体准确性进行评估,掩盖了一个关键现实:大型语言模型(LLMs)在简单查找方面表现出色,但在聚合和算术等复杂操作中却面临挑战。为揭示这种差异,我们引入了一种新颖的操作级表格问答(Operation-wise TableQA)任务,提出了细化的问题分类法,并发布了两个数据集WikiTQ-ow和TabFact-ow以供评估。
针对建模瓶颈,现有方法将表格展平为线性文本,破坏了固有结构并引发“中间迷失”问题,这对复杂的跨行推理构成了主要障碍。此外,它们通常从头开始推理,忽略了在类似操作中共享的可重用模式。为了解决这些局限性,我们提出了技能增强的表格图推理(SkillTGR)框架,用于自我进化的结构化推理。
具体而言,SkillTGR将表格表示为具有显式行-列-单元格结构的属性图,其中LLMs计划和执行动态链以检索证据子图进行图遍历推理。在此基础上,SkillTGR建立了一个分层的技能库(SkillBank),将推理轨迹提炼为基于认知启发式的抽象技能,然后混合检索成功和失败的技能以进行对比增强的表格图推理,从而实现持续的自我进化。大量实验表明,SkillTGR的整体性能平均提高了5.91%,操作级提升6.03%,同时减少了19.76%的令牌消耗和27.64%的推理延迟。我们的代码和数据将在发表时发布。
博主点评: SkillTGR框架通过将表格视为图结构,充分利用了表格的内在特性,并引入了技能增强的推理方式。这种方法不仅提升了问答的准确性,还有效降低了资源消耗,展示了表格推理领域的先进性与未来的发展方向。其在操作级别的细化评估为后续研究提供了重要的参考价值。