NeFut Logo NeFut
EN 管理员登录

[AI学术] 外部化 CPDAG 摘要提升 LLM 因果推理

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Graph #LLM

在 Corr2Cause 任务中,目标是判断一个因果声明是否在所有与观测到的相关性和条件独立性兼容的 DAG 中成立。我们将其视为潜在对象推理:标签由 CPDAG 查询定义,但自由形式的思考链往往把马尔可夫等价类问题简化为局部模式匹配。为此我们提出 结构化思考(Structured Thinking),一个两轮的流水线:第一轮将 CPDAG 摘要外部化为带类型、受模式约束的图结构;第二轮基于该图状态给出答案。

实验在 Corr2Cause 完整测试集上,使用 Qwen3.5-27B 时,结构化思考将 $F_1$(Yes) 从 $73.0$ 提升至 $86.4$,相较于强基线 PC‑instruction 提升 $13.4$ 个百分点(McNemar $p=2.4\times10^{-6}$,bootstrap $95\%$ CI [$+8.4$, $+18.6$])。在三个全 ID 种子上,平均提升 $+8.1 \pm 5.3$ 个百分点。对照实验使用 PC‑scaffold 的两轮自由文本,仅得到 $67.6$ 的 $F_1$,说明仅提供详细的 PC 框架而缺乏结构化中间表示不足以提升性能。相同趋势在 Qwen3.6-27B、Paraphrase‑OOD 和 GPT‑5.4‑mini 上复现。若对生成的 CPDAG 进行随机扰动,性能下降 $12.0$ 个百分点。完整的拆分审计显示生成的 CPDAG 与参考图高度一致(ID 骨架 $F_1$ 为 $0.960$,完全匹配率 $75.9\%$)。这些结果支持一个有界设计原则:外部化决定标签的潜在对象、约束其形式,并检验下游答案是否真正利用了该对象。

点评: 结构化思考通过显式建模因果图,实现了显著的性能提升,验证了外部化潜在对象的有效性。

原文链接: https://arxiv.org/abs/2609.31071

[h] 返回首页