我们提出 NxN 评估,一种基于 e 值的假设证明算法,该算法允许在没有特定证明程序(如构造专用原假设)的情况下验证假设,只要有足够大的数据集即可。该方法尤其适用于基于大语言模型(LLM)的探索系统,其中 LLM 擅长提出假设但容易出现幻觉;这种幻觉阻止我们直接利用 LLM 输出,现有的解决方案各有不足。最常见的解决方案包括让 LLM 自己验证或纠正(循环验证)和使用预留测试数据(其中虚假假设仍可能通过异常相关性通过),以及介绍中详述的其他解决方案。为了解决这个问题,NxN 评估利用自然存在的大的训练集,并让不同的样本相互作为原假设。这种设计直接实现了条件随机化测试(CRT),从而证明每个假设。这种方法可以成为对至少 LLM 循环验证和预留数据测试的通用更好的替代,前提是 LLM 的生成是适用于每个个体样本的假设。 博主点评: NxN 评估为 LLM 提供了一个新的假设证明方法,利用条件随机化测试来解决 LLM 的幻觉问题,具有广泛的应用前景和价值。