摘要
现有的工具使用基准仅报告复杂多步骤任务的单一成功率。受认知科学启发,我们将工具使用与工具发现区分开来,并将后者分解为以下几个部分:好奇心(模型发现构建工具所需部分的能力)、识别(模型发现创建工具过程的能力)以及效率(模型在创建后使用工具的能力)。我们展示了这一框架可以应用于现有的发现任务,例如 Voyager。
此外,我们提供证据表明识别能力与模型规模呈反比关系,并引入并分析了一类组合游戏以说明这一点。我们还在一个旨在模拟现实世界任务的独立环境中观察到了反向缩放现象。
博主点评: 本文提出的工具发现框架为理解 LLM 在复杂任务中的表现提供了新的视角,尤其是通过细分工具发现过程的不同要素,能够更好地评估模型在实际应用中的有效性和局限性。