AI 的规模化研究越来越多地评估将预训练模型与检索、搜索、验证、工具和交互相结合的系统。然而,仅凭在更大预算下取得更高分数并不能直接说明额外资源应如何分配。本文通过对预训练、测试时计算、检索以及代理评估四类资源的证据进行比较,区分已测试的具体过程的表现与在同一资源上理论上可能达到的最佳表现。综合分析发现,现有证据中常出现三类不匹配:在答案被选定之前就计入成功、使用了部署系统实际不可获得的信息、以及在比较中遗漏了部分成本。为此提出了“能力曲面”概念,将性能视为预算、机制和可用信息的函数。通过若干解析示例展示,评价指标、部署规模、选择规则和停止策略如何影响资源分配的结论。进一步引入“资源信封”框架,系统记录任务、开发与运行时资源、信息获取方式以及产生报告分数的具体过程。将该框架应用于已有对比实验,可明确哪些结论得到证据支持,哪些部署层面的疑问仍未解答。最终的框架指出,选择可行系统需要的比较维度,并激励在不同任务和运行条件下检验分配规则的迁移性。本文不主张通用的规模律,也不把基准提升等同于通用智能的提升。
点评