NeFut Logo NeFut
EN 管理员登录

[AI学术] 数据混合作为混合实验:响应面方法与大语言模型预训练的最优设计

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

数据混合是大语言模型(LLM)预训练中的核心设计问题:在固定的 token 预算下,需要决定每个领域分配多少数据。最近的代理方法通过在候选混合上训练小模型、拟合响应模型,再利用响应选择大规模训练的混合。我们指出,这一工作流本质上是经典的混合实验。

在该视角下,数据域是混合成分,token 份额是成分比例,代理训练运行是实验设计点,验证损失在概率单纯形上定义了响应面。我们采用稀疏二阶 $\text{Scheffé}$ 响应面模型,并构建对模型鲁棒的 $\mathcal{I}$-optimal 设计用于代理数据混合实验。

以 RegMix 为实证案例,展示了该框架如何解释观测到的混合响应并设计更高效的代理实验。$\text{Scheffé}$ 分析表明,领域价值高度关联:若干在加性效应下表现弱的领域,通过两两交互,尤其是与网页文本的组合,变得有利。稀疏 $\text{Scheffé}$ 模型在不同模型规模间保持混合排序,并在提供显式的加性与交互分解的同时,竞争力不逊于灵活的机器学习预测器。

在基于观测到的代理训练响应校准的模拟研究中,模型鲁棒的 $\mathcal{I}$-optimal 设计在剔除约 25% 原始代理运行后仍能恢复相关的混合排序。

这些结果表明,LLM 数据混合不仅是预测问题,也应视为实验设计问题,代理混合本身可以被选择以提升统计效率。

博主点评:本文将 LLM 数据混合提升到实验设计层面,提供了可解释且高效的混合实验框架,对实际预训练资源分配具有重要指导价值。

原文链接: https://arxiv.org/abs/2608.23922

[h] 返回首页