TsuGO是一种新的过程级别的LLM推理基准测试,用于评估LLM推理中的搜索效率。它通过围棋的生死问题来评估LLM的搜索能力。这些问题提供了封闭和可验证的解决空间,具有内在的对抗结构,使得候选生成、响应检查、分支比较和回溯成为推理的必要组成部分。 TsuGO通过限制解决空间,分离领域知识和搜索组织,将思维链(CoT)解析为结构化的搜索树,并报告搜索效率以及令牌效率和其他诊断指标和可视化。 实验表明,当前的LLM仍然远远没有达到稳定的解题能力:更强大的模型通过更早地找到正确的候选并在高产分支上维持努力而成功,但大多数模型仍然更像无指导的搜索算法,而不是神经引导的KataGo。 更长的CoT或更高的令牌效率并不一定意味着更好的搜索。 我们的结果表明,搜索组织和推理资源分配是LLM推理评估中缺失的维度。 博主点评: TsuGO为评估LLM的搜索效率提供了一个新的视角,通过围棋生死问题来评估LLM的搜索能力,揭示了LLM推理中搜索组织和资源分配的重要性。