NeFut Logo NeFut
EN 管理员登录

[AI学术] 我们真的在做少样本学习吗?对预训练假设的批判性审视

发布于:2026-09-13 22:00 最后更新:2026-09-15 01:15
#AI #Machine Learning #Neural

本文系统比较了四种预训练策略:不预训练、类不相交的同域预训练、监督的异域预训练以及无标签的异域预训练。实验覆盖八个数据集、三种少样本网络结构以及多种way‑shot设置。结果显示,仅类不相交并不能消除目标域信息的影响。同域预训练相较于不预训练平均提升33.41个百分点,监督的异域预训练提升23.75个百分点,说明域重叠带来约9.66个百分点的乐观偏差。虽然异域预训练更符合目标域数据稀缺的实际场景,但其效果强依赖源‑目标域的兼容性。进一步实验表明,标签并非必需,基于数据增强的无标签策略平均提升27.71个百分点,几乎等同于监督异域预训练的27.97个百分点。作者还提出基于描述子的源域选择方法,可在预训练前估计源域适配度,达到仅比最优选择高1.37个百分点的中位差距。总体而言,研究呼吁摆脱同域预训练作为少样本评估的默认协议,因为它在真实数据稀缺情形下会高估性能。

点评

原文链接: https://arxiv.org/abs/2609.10851

[h] 返回首页