大型语言模型(LLM)在表格问答任务上表现出色,但随着表格规模增大,答案准确率会下降。我们发现这种下降并非对所有问题类型均匀发生,定位敏感型问题受无关表格内容干扰尤为严重,而需要更广泛证据的问题仍能从全表推理中获益。
基于此观察,本文提出一种问句自适应框架,能够在局部子表推理和全表推理之间动态切换。框架首先通过操作感知的表分解生成针对特定问题的子表,然后利用预测的问题类型决定采用哪种推理模式。
为评估证据选择的质量,我们引入了银标准子表,并基于真实长表构建了 SLQA 基准。实验在 WikiTQ 与 SLQA 上进行,结果显示局部化对 lookup 与 local reasoning 类型的问题提升显著,而在整体上自适应选择局部或全表推理能够取得最佳性能。
这些发现表明,长表问答不仅需要研究如何进行局部化,还必须决定在何种情况下进行局部化。
点评