NeFut Logo NeFut
EN 管理员登录

[AI学术] 托管 LLM 的复制性、测量敏感性与持久性评估

发布于:2026-09-23 22:00 最后更新:2026-09-24 00:40
#Machine Learning #LLM #Artificial Intelligence

行为评估在托管语言模型上可能出现差异,原因可能是服务本身、测量工具或两者同时变化。为此我们提出三类验证问题:① 在历史配置下使用新数据是否能够复现先前发现(复制性);② 在相同标识下重新构建评估‑推理配置后端点是否改变(测量敏感性);③ 在同一测量工具下,多个后续标识的结果是否保持一致(持久性)。

Regent Chess 是一个顺序环境,能够精确记录隐藏的可变状态,使得在动作时刻即可将模型的声明与真实情况对比得分;正值端点表示相对于匹配的均匀基准表现更差。

在复制实验中,先前报告的 Gemini 3.1 Flash‑Lite 劣势在使用其历史配置的全新对局中再次出现,端点为 +0.0530,95% 置信区间为 [+0.0329, +0.0714]。

在同一天、相同公共标识下进行的后‑重建(H/R)比较显示,重建后的模型‑均匀端点比原始配置低 0.0429,置信区间为 [+0.0182, +0.0667]。该比较中六个配置组件全部共同变化,未能单独隔离任何组件的影响。

在持久性实验中,使用重建的 R 配置,对同窗口 4K 的前瞻性冻结、交叉插入比较发现 Gemini 3.1 与 Gemini 3.7(发布版本和产品层级不同)之间的端点符号发生翻转;额外的描述性和探索性单元也呈现相同方向的模式。额外的服务期贡献仍未解决,估计为 -0.0166,置信区间为 [-0.0483, +0.0157]。

因此,复制性、测量敏感性和持久性在同一次评估中可能得出截然不同的结论,建议在报告托管模型行为时显式标注测试标识、服务期间、测量工具以及推理配置。

点评

原文链接: https://arxiv.org/abs/2609.22478

[h] 返回首页