大型语言模型(LLM)在众多自然语言处理任务上表现突出,但其多步逻辑推理能力仍未得到充分验证。Chain‑of‑Thought(CoT)提示通过让模型生成中间步骤提升了推理效果,却缺乏评估这些步骤之间连贯性的手段。本文提出一种轻量级评估策略,利用 Transformer 注意力头中的查询(Q)与键(K)对齐程度来衡量逻辑一致性。我们在若干精选的注意力头上计算一次前向传播,提取“QK‑score”,该分数能够区分有效推理和无效推理的潜在表征,提供了相较于传统消融方法更具可扩展性的替代方案。实验在多个逻辑推理基准上进行,结果显示该评估方法对干扰项更具鲁棒性,并能捕获更深层次的推理过程。评测覆盖模型规模从 1.5 B 到 70 B 参数不等。
总体来看,QK‑score 为逻辑一致性提供了直观且高效的度量,有望在未来的模型评估与调优中发挥重要作用。点评