NeFut Logo NeFut
EN 管理员登录

[AI学术] 科学矛盾在翻译中的丢失

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

两项科学发现可以在表面上出现分歧,却并不真正相互矛盾。判断它们是否冲突的关键在于它们是否描述了可比的测量。我们通过语言模型在这一决策点上的表现进行研究。

在受控实验中,我们构造了一个不可满足的 XOR 约束系统,并将其约束翻译成来自不同实验室的科学报告。

这形成了一个简单的两难:模型是选择最符合约束的方案,还是选择更符合生物学期望的方案?

当约束以直接的形式呈现时,GPT‑5.6 Sol 与 Claude Opus 5 能分别在 90% 与 96% 的案例中恢复出最有支持的方案。

然而在科学性叙述中,模型的行为出现分歧。Claude Opus 5 往往倾向于生物学预期的方案。去除这种生物学偏好后,模型恢复最佳方案的比例从 27% 提升至 79%(p 值显著)。

这些结果表明,语言模型在解释科学文本时会受到隐含领域偏好的影响,可能导致对实际约束的误判。

点评

原文链接: https://arxiv.org/abs/2609.38621

[h] 返回首页