抽象与推理语料库(ARC)已成为评估 AI 模型通用抽象推理和流体智力的主流基准。但传统 ARC 只考察模型对测试输入输出网格的正确预测,忽视了抽象技能应具备的多样能力。为此我们提出 PotARCin,它在原有 ARC 基础上加入五个评估维度:定义(Definition)、分类(Classification)、受限生成(Constrained Generation)、编辑(Editing)和逆向(Inversion)。
PotARCin 通过程序化方法为每个 ARC 任务生成新的实例,并对给定输入进行多种变换,实现超越固定输入‑输出对的动态生成抽样。我们在 ARC‑AGI‑1 训练集上对五种最先进模型进行评估,发现标准 ARC 准确率与 PotARCin 多维评估之间存在 25%~52% 的性能差距,并且多维评估会重新排序在单一准确率上相近的模型。
进一步实验分析了生成抽样的影响、不同扰动类型的难度以及模型自洽性问题。结果显示,模型即使能够正确陈述任务的形式化规则,也常在实际推理时自相矛盾。我们还构建了 P‑ARC——一个全手工制作的留出测试集,所有模型在五个维度上的准确率仅为 1%~8%,凸显了对抽象推理能力进行更全面评估的必要性。
点评