大多数可主动的问答系统在查询时才进行语义重建,尤其在包含修订、草稿、撤回、删除和不同可信度来源的语料库时,需要每次读取时重新构建当前状态,成本高且不可靠。
我们提出“摄取时事实编译”架构,在语料库被摄入或变更时完成一次性处理。原始段落被改写为自包含事实;修订、删除、生效日期和来源可信度的规则一次性解析;结果以带有来源和修订溯源的类型化记录存储。
查询时,低成本模型直接读取编译好的记录,无需从噪声候选中重建。实验在五个随机种子下进行的合成任务中,查询时重建的方案在30次试验中仅有1次得到正确的值、来源和修订,而编译后方案全部30次成功,平均读取成本降低12.89倍。
对于更简单的修订问题,两种架构均能得到准确答案,但编译路径使用的 token 数少21.6倍。另一次测试显示,事实改写将冗长的美联储对话长度约减半,同时保持高来源蕴含;而简洁的维基百科文本几乎不变。
这些结果支持一个狭义但实用的结论:一次性解析语料库状态可以让后续问答对廉价模型更便宜、更可靠。我们已开源实现,采用 MIT 许可证,并提供实验制品。
点评