NeFut Logo NeFut
EN 管理员登录

[AI学术] LLM 能否真正理解上下文?基于知识图谱的评估框架

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

大型语言模型(LLM)在语言生成上取得了显著进展,但核心问题仍未解决:模型是对上下文有真正的理解,还是仅凭大规模模式匹配得分?这里的上下文理解指模型能够从给定文本中提取相关信息,构建内部表征,并在此基础上进行推理,输出事实一致且与上下文相符的答案。传统评估手段如 BLEU 和困惑度只能捕捉表层表现,无法衡量答案是否真正基于上下文。为弥补这一缺口,我们提出了一套基于知识图谱(KG)的评估框架,专注于问答(QA)场景中的上下文理解。核心指标为 S3KG(Semantic Structural Similarity for KGs),它将结构相似度和语义相似度融合为单一得分。框架还包括诊断分析模块,可在三元组层面定位并分类推理错误,实现细粒度的模型失效剖析。实验覆盖九个基准数据集,S3KG 相比最强基线在 F1 上提升最高 $+7.6$ 点,AUROC 达到 $0.973$。

该评估体系为后续 LLM 的上下文推理能力提供了更严格的检验手段,也为模型改进指明了具体的错误类型。

原文链接: https://arxiv.org/abs/2609.30484

[h] 返回首页