摘要
大型语言模型在总结科学文本时会出现数字和单位的幻觉,这种失误可能悄然颠倒科学声明。我们将这种错误检测重新定义为类型验证,提出了一个五类类型量错误分类法和一个1500项基准数据集,重写自PMC和arXiv源,由两名独立的LLM注释员标注并进行裁决(Krippendorff's alpha = 0.882)。
我们对一个经过微调的ModernBERT编码器在该基准上的表现进行了评估,结果达到宏F1 = 0.899,远超任何现成的神经事实检查器。然而,四个探针揭示了一个明显的结构盲点:在物理等价量的规范等价重写(例如,95{°C}和368.15 K)上,其准确率骤降至36.5%。
我们提出了符号增强(Symbolic Augmentation),这是一种训练时框架,反向运行符号验证器的模块以生成保持标签的增强训练数据。这种增强将规范等价性的鲁棒性提升至98.2%,同时略微改善了分布内的准确率(宏F1:从0.899提升至0.902);增强后的编码器在没有推理成本的情况下与一个封闭前沿的LLM相匹配,并在外部基准(SciFact-Open二分类宏F1:从0.791提升至0.828)中转移。
两个负面结果进一步明确了这一主张:符号特征作为辅助编码器输入并无助益,而符号银标签在教师噪声下呈现负向扩展。综上所述,这些结果表明训练时的增强是符号与学习组件之间的正确整合点。
博主点评: 本文提出的符号增强方法有效提升了神经网络事实检查器在处理物理量规范等价性时的准确性,显示出符号方法与深度学习结合的潜力。这种创新的训练策略为未来的模型改进提供了重要的思路。