两项科学发现可以在表面上出现分歧,却并不真正相互矛盾。判断它们是否冲突的关键在于它们是否描述了可比的测量。我们通过语言模型在这一决策点上的表现进行研究。
在受控实验中,我们构造了一个不可满足的 XOR 约束系统,并将其约束翻译成来自不同实验室的科学报告。
- 方案 A 满足更多约束,但与已知生物学预期的吻合度较低。
- 方案 B 满足的约束较少,却更符合生物学预期。
这形成了一个简单的两难:模型是选择最符合约束的方案,还是选择更符合生物学期望的方案?
当约束以直接的形式呈现时,GPT‑5.6 Sol 与 Claude Opus 5 能分别在 90% 与 96% 的案例中恢复出最有支持的方案。
然而在科学性叙述中,模型的行为出现分歧。Claude Opus 5 往往倾向于生物学预期的方案。去除这种生物学偏好后,模型恢复最佳方案的比例从 27% 提升至 79%(p 值显著)。
这些结果表明,语言模型在解释科学文本时会受到隐含领域偏好的影响,可能导致对实际约束的误判。
点评