知识密集型语言模型系统通常把外部知识表示为文本块或静态图,难以处理概念演化、时间点推理以及已验证与推断知识的区分。为此我们提出 概念生命周期模型(CLM),将概念建模为持久的、基于图的、具备时间版本的实体,并显式记录来源与认知状态。基于 CLM,我们设计了 概念驱动注意力(CGA),通过两种形式将概念图注入 Transformer 计算:
- 形式 A:在自注意力中加入图偏置,使注意力分布倾向于图结构;
- 形式 B:在跨注意力层对概念节点进行门控,以融合概念信息。
我们在受控实验中使用禁用机制基线进行评估。对 200 条 MuSiQue 与 HotpotQA 题目(检索固定)进行测试时,概念图检索能够恢复显式的多跳路径,但并未提升证据召回率。形式 A 在金概念上的注意力是干扰概念的 2.76 倍,但在禁用形式 A 时同样出现该比例,说明学习到的偏置几乎不存在,答案并未改变。形式 B 在保持身份不变的情况下将 F1 从 0.188 提升至 0.221,然而使用控制概念时得到 0.213,表明大部分提升来源于模型容量的增加。
在 LongMemEval 上,显式的时间表示使所有测试生成器(参数规模最高 122B)答案准确率提升 13~25 分;简化的 CLM 版本解析与传统的时间序列序列化效果相近,因为概念身份难以可靠建立。针对合成的来源独立任务,基于协议的认知状态将小模型的无依据断言从 28% 降至 0.1%,在 72~122B 大模型中则从 19~68% 降至 0~5%。
总体来看,实验支持将时间有效性与认知状态显式化,而没有禁用机制对照的图注意力诊断并不具备解释力。
点评:概念生命周期模型为知识表示提供了时间和来源的双重视角,CGA 的两种注入方式在受控实验中表现出不同的贡献,尤其是形式 B 的容量效应值得进一步探索。