摘要
在测试阶段,有两种标准方法可以增加计算资源:让模型进行更长时间的推理,或是进行更多次的尝试并保留最佳结果。然而,这两种方法都有一个隐含的限制:它们都是内部的。每一个额外的标记都来自同一组冻结的权重和相同的提示,因此无法向模型传达任何它尚未知晓的信息。我们研究了一种第三种方式,即交互:模型提出一个工件,外部工具观察其实际表现,然后模型进行修正。每个循环都引入了一个真实的观察,因此交互突破了前两者所遇到的瓶颈。
我们认为一个单一变量控制着这个第三个维度,即“基础”,并且它必须在循环的两侧都有效。驱动修正的反馈必须来自一个实际观察到缺陷的工具,评分结果的指标也必须如此。在固定标记预算下的困难编码任务中,仅依赖推理或最佳-N采样的方法都达到了瓶颈(即使后者由神谕选择最佳样本),而每一种交互策略则持续改善;我们的提议-评审者架构达到了100%的通过率且无运行间方差,该增益在三种模型家族中均保持一致。
在渲染的视觉工件中,通常的评判者(视觉-语言模型,VLM,读取屏幕截图)将15个可见缺陷中的14个评为“完美”,因为截图在评判者看到缺陷之前隐藏了这些缺陷。一个测量真实布局的工具显示,循环在四种模态下消除了40-74%的缺陷;而同样的VLM作为评审者,在测量工具修复的地方却使幻灯片布局变得更糟。交互扩展是独特且真实的,只有当反馈和指标都被基础化时才能显现出来。
博主点评: 本文提出的交互扩展方法为模型在测试阶段的计算能力提供了新的视角。通过引入外部观察工具,模型能够获得真实反馈,从而不断改进。这一方法在不同模型家族中均表现出色,显示了其广泛适用性。未来的研究可以进一步探索如何优化反馈机制,以实现更高效的交互修正。