NeFut Logo NeFut
EN 管理员登录

[AI学术] 小型语言模型的自我反思能力:引入自我反思微调(IFT)

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #optimization

在本研究中,我们探讨小型语言模型是否能够检测并报告自身内部激活的扰动。具体而言,我们通过激活引导的方法,向模型的残差流中注入概念向量,并测量模型是否能够准确报告这些扰动。我们首先指出,之前工作的二元检测范式(让模型回答“是”或“否”来判断是否检测到注入的想法)在小型模型中存在混淆,因为激活引导会使模型偏向于肯定的响应,而不论问题内容如何。因此,我们提出了两种无混淆的评估范式:句子定位(识别$N$个句子中哪个句子被扰动,机率为$1/N$)和强度比较(识别两句子中哪个句子的注入更强,机率为$50 ext{ extbackslash%}$)。

在对来自两个家族(Llama-3.2和Gemma-4)的六个模型进行评估后,我们发现参数仅为2B的小型模型在自我反思上能够可靠地超过随机机率,而自我反思能力通常随模型规模的增加而提高。然而,Llama-1B的表现处于随机机率或以下。接着,我们引入了自我反思微调(IFT):在模型自身扰动的前向传播中构造的句子定位示例上进行监督微调。IFT将Llama-1B的句子定位准确率从$9.6 ext{ extbackslash%}$提升至$60.6 ext{ extbackslash%}$(提升了$6 imes$),并且这种提升在零-shot情况下对保持的强度比较任务也具有一定的普适性($30.2 ext{ extbackslash%} o 52.2 ext{ extbackslash%}$)。IFT同样提升了3B和8B模型的自我反思能力,同时对标准能力基准造成的退化微乎其微。我们的结果表明,自我反思能力并非仅由规模决定:它可以被直接训练,这样做解锁了潜在的自我监控能力,对AI透明度和对齐性具有重要影响。我们的代码可在这里找到。

博主点评: 通过引入自我反思微调(IFT),研究者们成功提升了小型语言模型的自我监控能力,这为AI的透明度与对齐性提供了新的视角与方法。这种训练方法的创新性将可能推动小型模型在复杂任务中的表现,值得关注。

原文链接: https://arxiv.org/abs/2607.14111

[h] 返回首页