在这篇论文中,我们记录了一种在前沿大语言模型中观察到的失败类别——异常链崩溃,主要出现在嵌套条件规则的合规性评估中,例如“A 是必须的,除非 B 适用,除非 C 覆盖 B”。这种失败在首次观察中会重现,但其经验表现不稳定:在 2026 年 3 月和 4 月之间,多个失败单元在同一模型别名下悄然关闭,没有版本更新(例如,构建保险的 GPT-5.4 从 96.6% 提升至 100%,在相同的提示和框架下)。对于受监管的工作流程,前沿模型的准确性是一个不断变化的合规边界,随时可能发生变化。
我们提出了 Aethis Eligibility Module,这是一种神经符号架构,LLM 从权威来源生成规则,而基于 SMT 的层以确定性方式执行这些规则,确保与所编写的规范一致,无论模型漂移、推理努力的默认值或提示格式如何。
我们提供了三种证据基础: (i) 在四个监管领域的 225 个场景的控制基准记录了这种模式,并在复制中记录了部分关闭的漂移; (ii) 在建筑保险上的 20 个场景的对抗扩展,模型得分为 20/20,其中一种前沿配置(GPT-5.4 在低推理努力下)同样得分,而其他三种模型,包括在评估时的 Anthropic 最强模型,未能覆盖同一边缘案例; (iii) 在九个经过同行评审的 LegalBench 任务上的外部验证,949 个保留案例的结果显示,该引擎的准确性显著高于所有三种前沿模型(结合 McNemar 的 p 值)。
博主点评: 通过记录异常链崩溃这一现象,本文强调了前沿大语言模型在合规性评估中的不稳定性。Aethis Eligibility Module 提供了一种解决方案,结合了神经网络和符号逻辑,展现了未来在规则执行中的潜力。尤其是在监管环境中,模型的准确性和稳定性是至关重要的。