本文提出一种基于文本的多智能体版《Clue》(线索)棋盘游戏环境,用于评估大语言模型(LLM)的多步演绎推理能力。玩家需要从一系列观察中推断隐藏信息,在回合之间保持推理一致性,并在新约束出现时更新信念,从而暴露当前模型在跨步证据整合和约束维护方面的局限。
我们实现了六个基于 LLM 的玩家:分别使用 GPT-4o-mini 和 Gemini-2.5-Flash,每个模型族部署三名代理。通过多轮对局收集基线表现,记录每一步的推理日志。
随后引入工具增强方案:构建结构化的可能性矩阵(possibility matrix),将推理日志中隐含的游戏状态转换为显式的剩余可能集合。矩阵在每回合更新,编码记忆和演绎约束,使代理无需自行维护长程记忆或复杂约束求解。
我们将工具增强的代理与基线进行对比,评估在策略推理环境中工具对推理质量和任务成功率的提升效果。实验表明,可能性矩阵显著提升了模型的一致性保持和约束推理能力,尤其在长序列推理场景下表现更稳健。
点评