NeFut Logo NeFut
EN 管理员登录

[AI学术] Lightning Weave:通过能力组合提升推理模型的准确性‑效率前沿

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

核心目标是提升推理的准确性‑效率前沿。准确性和推理速度往往受不同的推理行为驱动,单纯优化一项会牺牲另一项。已有的后训练模型各自擅长其中一项,形成了互补的能力。

我们提出 Lightning Weave,一种后训练框架,利用 on‑policy distillation 将这些独立学习到的能力在同一学生模型中进行组合。每项能力用 policy shift 表示,即从原始模型到专精模型的策略变化。框架在共享的学生 token 状态上对齐 log‑ratio shift,并通过 Tilted‑Target DOPD 将缓存的信号转化为稳定的学习目标。

具体做法是:对每对锚模型(anchor pair)只评估一次缓存轨迹,然后在学生训练阶段直接使用这些分数,无需同时运行多个锚模型。这样既保持了信号的完整性,又大幅降低了计算开销。

在多种学生模型和数学、代码基准上实验,Lightning Weave 显著提升了基线学生的表现,并在准确性‑效率前沿达到了最新水平。以 Qwen3.5‑4B 为例,HMMT 2025 的准确率从 59.2% 提升至 64.0%,同时响应 token 减少 10.7%;LiveCodeBench v5 的准确率从 41.7% 提升至 54.2%,响应 token 减少 9.6%。通过调节锚信号的相对强度,可得到一条强劲的经验 Pareto 前沿。

这些结果表明,Lightning Weave 为通过能力组合实现高效推理提供了一条实用路径。代码将在近期开源。

点评

原文链接: https://arxiv.org/abs/2609.14708

[h] 返回首页