摘要
在基于大型语言模型的闭环通道配置搜索中,初步结果表明神经网络的宽度可以通过可执行代码生成和准确性反馈进行优化。然而,这些结果是基于相对稀疏的有效评估集得出的,尚不清楚观察到的优化行为是否能转移到更密集的采样机制,以及在评估更多生成网络时是否会出现额外的架构规律。
为了验证这一点,研究将搜索设置扩展至每个微调周期250个候选网络。
研究分析
分析涵盖了8个完整周期中生成的2000个候选网络,在经过任务和元数据过滤后,获得462个经过验证的CIFAR-100评估。每个周期的平均准确性表现出正线性趋势,斜率为9.87e-4 (p=0.043)。表现最佳的前沿模型的准确性提升显著:从0.3144提高到0.3676,同时,前5名和前10名的周期平均值均呈现正趋势。
扩展后的运行还揭示了参数效率的改善。最佳模型在11.8M参数下达到0.3676的准确性,而早期高性能模型在166.5M参数下仅为0.3144。
除了准确性,较大的样本量还暴露出难以从稀疏观察中评估的架构规律。在经过验证的候选中,有41.8%的通道宽度为非二次幂,最强模型共享的结构化通道分配模式特征为中等的早期宽度和扩展的中间或后期块。这些发现表明,最初研究中观察到的通道搜索信号能够转移到更复杂的设置中。
博主点评: 本研究通过扩大候选网络的规模,揭示了大型语言模型在通道配置中的潜力,表明更高的参数效率和准确性之间的平衡。研究结果强调了架构规律的重要性,为未来的模型设计提供了重要的指导方向。