NeFut Logo NeFut
EN 管理员登录

[AI学术] QVAC Genesis III:大规模高质量开放合成 STEM 语料库用于高效语言模型预训练

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #LLM #Open Source

高质量的预训练数据是面向边缘 AI 与设备端部署的教育和 STEM 专用语言模型的关键瓶颈,尤其在 token 预算极其受限的场景下更为突出。虽然大型机构在私有语料上不断扩大模型规模,开源生态却缺乏能够以高每 token 学习价值支撑小模型的 STEM 合成数据集。为填补这一空白,我们推出 QVAC Genesis III——一个包含 191.43 B token、覆盖 19 个领域、跨多难度层级和教学风格的合成 STEM 语料库。该语料库采用双重生成策略:利用弱边缘规模学生模型进行有针对性的教师蒸馏,学生的错误被转化为纠错解释,正确输出则被扩展为对所有选项的对比推理。我们进一步提出 LLM‑as‑a‑parser 评估协议,从自由形式的输出中抽取最终答案,并同步记录准确率和答案有效性。通过在 1.7 B 参数模型上进行从零训练的对照实验,使用 QVAC Genesis III 训练的模型在 ARC、GPQA Diamond 与 MMLU STEM 基准上始终优于使用开源合成语料 Cosmopedia‑v2 或公开的 Cosmo‑1B 模型,ARC‑E 提升最高 +28.57%,ARC‑C 提升 +21.35%,有效答案率最高达 99.45%。

点评

原文链接: https://arxiv.org/abs/2609.19513

[h] 返回首页