NeFut Logo NeFut
EN 管理员登录

[AI学术] 隐式规则归纳与测试时任务嵌入在 ARC 类任务中的应用

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#algorithm #AI #Machine Learning

Abstraction and Reasoning Corpus(ARC)及其衍生基准用于检验模型在全新推理任务上的能力,但往往难以判断模型是捕获了任务的真实规则,还是利用了数据中的捷径。

Vision ARC(VARC)在预训练主干网络上额外加入一个可学习的任务嵌入,用以表示任务的变换规则。原始 VARC 在测试时对主干和任务嵌入同时进行训练(TTT)。

本文提出一种两步 TTT 流程:首先仅微调任务嵌入(Embed‑TTT),随后冻结该嵌入并微调主干网络。

在 ARC‑AGI‑1、ConceptARC 以及两套已知规则的受控数据集上,Embed‑TTT consistently 提升了任务嵌入的质量,使其与底层规则的对应关系更紧密,检索效果和对已知规则的线性探测均得到改善。

仅优化任务嵌入(占模型参数不到 0.01%)已能解决相当比例的 ARC‑AGI‑1、ConceptARC 与 Mini‑ARC 任务,而完整的两步流程进一步提升了最终性能。

任务嵌入能够恢复参数化规则的几何结构,展示了规则的组合能力,实现了规则间的插值但不支持外推,说明在 ARC 类评估中规则归纳与规则执行可以被明确分离。

这些发现呼吁设计能够更清晰地区分分布内外规则的基准,以推动对真正推理能力的评估。

点评

原文链接: https://arxiv.org/abs/2609.21181

[h] 返回首页