NeFut Logo NeFut
EN 管理员登录

[AI学术] PotARCin:抽象推理任务技能获取的多维评估

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#Machine Learning #LLM #Artificial Intelligence

抽象与推理语料库(ARC)已成为评估 AI 模型通用抽象推理和流体智力的主流基准。但传统 ARC 只考察模型对测试输入输出网格的正确预测,忽视了抽象技能应具备的多样能力。为此我们提出 PotARCin,它在原有 ARC 基础上加入五个评估维度:定义(Definition)、分类(Classification)、受限生成(Constrained Generation)、编辑(Editing)和逆向(Inversion)。

PotARCin 通过程序化方法为每个 ARC 任务生成新的实例,并对给定输入进行多种变换,实现超越固定输入‑输出对的动态生成抽样。我们在 ARC‑AGI‑1 训练集上对五种最先进模型进行评估,发现标准 ARC 准确率与 PotARCin 多维评估之间存在 25%~52% 的性能差距,并且多维评估会重新排序在单一准确率上相近的模型。

进一步实验分析了生成抽样的影响、不同扰动类型的难度以及模型自洽性问题。结果显示,模型即使能够正确陈述任务的形式化规则,也常在实际推理时自相矛盾。我们还构建了 P‑ARC——一个全手工制作的留出测试集,所有模型在五个维度上的准确率仅为 1%~8%,凸显了对抽象推理能力进行更全面评估的必要性。

点评

原文链接: https://arxiv.org/abs/2609.27288

[h] 返回首页