摘要
本研究测试了正确的逻辑判断在学习上下文影响下的反应。我们在一个精确标记的三段论推理基准上预加了一个软前缀,同时保持模型不变。软前缀是不可见的连续向量,因此我们通过它们在逻辑形式和接口变化中的行为特征来进行表征。
通过研究哪些前缀成功以及它们的效果如何推广,我们描绘了学习的上下文压力如何覆盖正确判断,并揭示模型逻辑稳定性的局限性。
在 Qwen3.6-35B-A3B MoE、Qwen3-8B 和 Gemma 4 31B 的实验中,学习到的前缀重定向了许多正确答案,并在未见的形式和接口变化中仍然有效。在与 Qwen3.6 MoE 和 Gemma 的重复测试中,它们在所有 16 个模型-方向-分割的比较中超越了配对随机控制,领先幅度达 37 到 99 个百分点。
Qwen3.6 MoE 的翻转率在措辞和提示变化中保持在 72% 到 90% 之间,而 Gemma 有效前缀的翻转率保持在 54% 到 56% 之间,相比之下,匹配的随机前缀翻转率不足 1%。
诊断测试显示,主导效应是对某一答案意义的广泛偏好,而不是固定符号强制或在任务间可靠转移的逻辑操作。这种偏好的形式在不同模型间存在差异。
在两个 Qwen 模型中,简单的评分模型通常能够预测哪些判断会翻转,但无法预测翻转的幅度,而 Gemma 的整体反应则更接近于同样的模型。
这些结果表明,成功的软前缀的主导行为效应是一种广泛的答案偏好,而剩余的反应则揭示了模型在逻辑稳定性方面的显著差异。
博主点评: 本研究揭示了学习上下文对逻辑判断的深远影响,尤其是在压力下的表现。通过软前缀的引入,模型的逻辑稳定性显得脆弱,暴露了其在理解和推理上的局限性,值得进一步探讨其在实际应用中的影响。