行为评估在托管语言模型上可能出现差异,原因可能是服务本身、测量工具或两者同时变化。为此我们提出三类验证问题:① 在历史配置下使用新数据是否能够复现先前发现(复制性);② 在相同标识下重新构建评估‑推理配置后端点是否改变(测量敏感性);③ 在同一测量工具下,多个后续标识的结果是否保持一致(持久性)。
Regent Chess 是一个顺序环境,能够精确记录隐藏的可变状态,使得在动作时刻即可将模型的声明与真实情况对比得分;正值端点表示相对于匹配的均匀基准表现更差。
在复制实验中,先前报告的 Gemini 3.1 Flash‑Lite 劣势在使用其历史配置的全新对局中再次出现,端点为 +0.0530,95% 置信区间为 [+0.0329, +0.0714]。
在同一天、相同公共标识下进行的后‑重建(H/R)比较显示,重建后的模型‑均匀端点比原始配置低 0.0429,置信区间为 [+0.0182, +0.0667]。该比较中六个配置组件全部共同变化,未能单独隔离任何组件的影响。
在持久性实验中,使用重建的 R 配置,对同窗口 4K 的前瞻性冻结、交叉插入比较发现 Gemini 3.1 与 Gemini 3.7(发布版本和产品层级不同)之间的端点符号发生翻转;额外的描述性和探索性单元也呈现相同方向的模式。额外的服务期贡献仍未解决,估计为 -0.0166,置信区间为 [-0.0483, +0.0157]。
因此,复制性、测量敏感性和持久性在同一次评估中可能得出截然不同的结论,建议在报告托管模型行为时显式标注测试标识、服务期间、测量工具以及推理配置。
点评