文档库会不断演进,指南和政策会被修订、取代并重新上传,导致相同内容以不同措辞出现,更新的版本可能细化或与早期版本冲突。这类不一致属于整个集合的属性,而不是单个文档的属性。现有方法把版本关联、去重和冲突检测视为独立的两两任务,标记完一对后即停止。
GVD 框架将跨文档的版本链接与规则层面的冲突解决统一在可审计的更新策略下。新文档通过双向规则对齐被分配到版本族,随后其规则与族记忆比较,识别出重复、矛盾、不对称的细化以及新知识。针对推理误判为中性的相关对,使用反事实跨度探测(Counterfactual Span Probing,CSP)进行纠正。
关系特定的策略会抑制重复,仅对有实质影响的变更进行升级审查,并保留版本血缘作为审计轨迹。整个流水线完全本地运行,不依赖大语言模型。
在 120 份企业文档、140 次摄入、59 个版本族的实验中,GVD 在版本族构建上达到 F1=0.97,规则层面一致性 F1=0.94,CSP 将规则一致性从 0.90 提升至 0.94。
点评