本文研究在机器解析法条时出现的噪声对形式逻辑的影响。我们以密苏里州法典为实验平台,使用两套独立实现的抽取器,对数值阈值的出现进行比对,发现假阴性率高达 0.43。为评估哪些蕴含关系能够在这种噪声下仍然可靠,构建了被动生存证书(passive survival certificate),针对 Duquenne‑Guigues 蕴含基(implication basis)进行检验。具体步骤如下:
- 逐属性计算两抽取器之间的分歧率;
- 在 1,000 次 Monte Carlo 试验中,以该分歧率重新抽样并重新构建蕴含基;
- 对每条蕴含计算单侧 Wilson 95% 下限,若下限 ≥ 0.95,则该蕴含被认证。每条认证蕴含附带前提的文本跨度和一个最小反例。
在 29,365 条密苏里州章节和 502 条印度中央法案章节上进行实验。预先注册的持出门槛(10 个法条族跨 7 个标题严格匹配,16 个跨 11 个标题容差 5%)全部通过。然而,在全局部署的误差模型下,93.2% 的持出章节未能达到信息量下限。进一步的 2×2 因子分析表明,导致下降的主要原因是校准率的迁移,而非样本选择。
证书可用但脆弱:必须在每章单独校准或容错部署。我们公开了全部代码、数据产品以及审计日志,其中包括一次被撤回的声明。
点评:该工作提供了一套可量化评估机器抽取法条逻辑可靠性的框架,虽受误差模型影响显著,但为法律技术的可验证性奠定了基础。