NeFut Logo NeFut
EN 管理员登录

[AI学术] 语言模型诚信评估中的工具效应:可审计的单系统示范

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#AI #Machine Learning #Open Source

摘要

语言模型的诚信评估通常将模型的判断视为对其本身的证据,而我们则测试了评估工具本身。我们构建了一个文本冒险世界,其中游戏引擎掌握任务是否可以完成,而非任何模型。语言模型在预算限制下进行游戏,最终必须声明任务完成、无法完成或尚未可决;引擎对每个判断进行评分。

决策规则在结果读取之前记录,并且运行文档绑定了他们执行的修订版本;预注册的强度因系列而异并予以披露。在玩家固定的情况下,工具选择显著改变了测量行为。在四个字节完全相同的锚点上,将两个判断语法扩展到三个判断,使得强声明从38/40降至7/40,而新的不完整判断占据了28/40的结果;在系列2中,93/158个有效游戏以不完整结束。

一条披露成功标准的句子使匹配实例的错误判断从18/59降至0/58,这得益于更少的决策点和更清晰的决策。固定配置的重复运行在4个实例中的3个上产生了不稳定的判断分布:单次运行将样本报告为倾向。一个正式预注册的叙述登记梯度被证伪;两个后验假设生成模式依然存在:登记的存在大约使强声明翻倍,而预算呈现对判断的影响大于登记内容(0.383米 vs 0.150灯笼)。叙述者将丰富的预算压缩至稀缺地标,但注册的中介测试返回了零结果。我们建议了一种四项检查的完整性协议来评估工具的有效性。

博主点评: 本文通过构建文本冒险游戏的方式,探讨了评估工具对语言模型判断的影响,强调了预注册和决策透明度的重要性,具有很高的实验设计价值。研究结果揭示了工具选择对测量结果的显著影响,为未来的模型评估提供了新的视角。

原文链接: https://arxiv.org/abs/2607.14399

[h] 返回首页