工具增强的大语言模型(LLM)代理会出现一种现有安全方法无法覆盖的错误:它们调用根本不存在的工具,或传递不符合任何模式的参数。传统防御要么聚焦于正确选择工具,要么在真实工具上设置使用限制,这两者都假设调用指向的是实际存在的工具。我们指出,这是一种结构性盲点:幻觉调用本身不属于任何门控的决策范围,因而无法被拒绝。\ \ 本文提供了五类工具幻觉的分类(H1‑H5),并以“Resolution Rung”作为基准:一种无需训练、基于注册表成员资格和签名校验的闭世界解析器。我们证明防御必须在任何因果门控之前执行,并指出唯一不可约的残余是借用的参数,其模式与合法调用不可区分。\ \ 在十个托管模型、两种调用接口上,我们共记录了322例真实幻觉。原始 JSON 接口的幻觉数量远高于结构化接口(34 对 3),且模型规模并未带来显著改善(675B 与 7‑8B 模型表现相近)。随后我们将研究扩展到模型上下文协议(MCP),在将多个服务器合并为同一命名空间时出现了新的幻觉来源——单一注册表无法表达的冲突与遮蔽。我们提出第二套分类(M1‑M5),在实际 MCP 场景中捕获了154例幻觉,其中包括在单注册表下表现良好的前沿模型。\ \ 我们发布了带版本的 Hallucinated‑Tools Benchmark(HTB),以便后续解析器在统一基准上进行比较。\ \ 点评:本文通过系统测量揭示了工具幻觉的结构性根源,并提供了一个轻量、可直接部署的闭世界防御框架,为后续研究指明了防御顺序和残余风险的方向。