NeFut Logo NeFut
EN 管理员登录

[AI学术] 样本、来源、空间:在人脑微观结构空间结构化表征学习中的数据规模分解

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #Neural

在大规模学习中,通常用样本总数来描述训练数据。但对于层次化、空间结构化的数据,同样的样本数可能来源于少数或多数来源,并在空间域上分布不同。为此我们将数据规模视为分配问题,拆分为唯一样本数、来源多样性和空间覆盖度三维。我们在显微全脑组织学中进行实验,其中“来源”指单个大脑,“样本”指特定空间位置的图像块。通过 93 次受控的对比学习预训练,模型利用空间邻近性作为监督,分别在样本分配、计算资源和模型容量上进行变动,使用来自 21 个人脑的 1160 万空间锚定图像块。实验表明,性能随唯一样本数增加、空间覆盖范围扩大、计算提升以及模型容量增大而提升。在固定样本总数的条件下,将样本分布在 1 到 18 个人脑之间并未带来显著提升,尽管在预训练中出现的受试者上表征的泛化能力显著更好。因而,受试者间的差异强烈影响泛化,但在固定样本预算下增加更多来源并无收益。研究确认,唯一样本数、来源多样性和空间覆盖是空间结构化表征学习中独立的数据扩展轴。

点评

原文链接: https://arxiv.org/abs/2609.31201

[h] 返回首页