人类的知识呈现出层次化、相互依赖的结构:掌握一个概念往往需要先掌握其前置概念,这一规律在知识空间理论(KST)中得到了形式化。近期的大型语言模型(LLM)在复杂推理任务上表现出色,但它们是否具备类似人类的知识结构仍未可知。为此,我们构建了一个基于 KST 的评估框架,专门用于检验 LLM 在数学推理中的知识依赖关系是否符合人类认知规律。我们选取了八种开源和闭源 LLM,对比真实人类学习者的表现,得到以下主要结论:
- LLM 常常违背知识依赖规则,未能利用上下文中提供的相关知识来提升对后续依赖题目的解答准确率;
- 各模型之间的知识结构缺乏一致性,体现在它们的知识分布重叠度极低;
- 这些结构性缺陷在传统的基于准确率的评估以及“LLM 充当评审者”的评价体系中几乎不可见。
综合上述实验结果,我们提供了行为层面的证据,表明当前主流 LLM 的知识组织方式并未遵循人类式的结构化模式。
点评