在 BabyLM 2026 Strict‑Small 赛道中,Qiushi Engine 在 1000 万词的语料和 1 亿次词出现的预算下,完成了一个长期、端到端的自主研究流程。整个流程分为三阶段:
第一阶段通过紧凑的复述、预算再投入以及残差增量学习,构建了一个前沿模型。第二阶段发现,精确重复和对齐复述在不同的目标关系和预测窗口下会产生不同的上下文使用模式。受控实验表明,恢复已知任务的性能并不保证模型在未见输入上仍能利用已学计算。基于此提出了可检验的数据高效学习原则:围绕预测所需的上下文依赖组织经验;分别设计可见信息、监督信号和保持机制;并分别测试学习、泛化和保持能力。
第三阶段在保留源文本的前提下,进一步掩蔽更局部的线索,对选定目标进行监督,并保持对常规掩蔽输入的预测能力。两个来自同一父模型的续写种子在九项指标的整体得分上均超过普通续写,整体分数从 42.02 提升至 42.25,第二代模型在 2026 年 9 月 8 日公开的 Strict‑Small 快照中取得最高 Overall。
后续工作探讨了压缩、关系锚、共享表征以及度量方法。模型已发布至 Hugging Face,代码和研究记录同步于 GitHub。整个过程展示了 Research RSI(研究递归自我改进):科学理解和方法创新不断改变后续问题和设计,新实验用于验证并细化这些创新。
点评