长上下文理解要求大语言模型在数万甚至数十万 token 的文档、对话或代码中进行推理,但真正与任务相关的证据往往稀疏且分散在大量无关或冗余信息中。为此我们提出先标记后摘要(Highlight-Then-Summarize,H2S)范式:首先在原始文本中定位与问题相关、来源可靠的证据片段,然后在问题条件下将这些证据压缩为简洁的摘要,最后基于摘要生成答案。
为训练该行为,我们构建了 H2S‑Dataset,收录 6,647 条来自 11 类基准的样本,平均上下文长度为 43.9K token,并提出 H2S‑RL,除了对最终答案的正确性给奖励外,还在证据选择和摘要构建阶段提供过程级奖励。
我们在 H2S‑Bench 上进行评估,该套件包含七个长上下文任务。在统一的 128K 输入、4K 输出预算下,H2S‑14B 获得平均得分 32.60,较 Qwen3.8‑27B 提升 10.17 分,并在所有开源模型中取得最佳整体成绩。H2S‑14B 同时获得最高的证据‑摘要质量分数,并在仅使用 4K 输出预算时保持 97.1% 的 16K 预算性能。这表明显式的证据选择与整合能够提升长上下文推理效果,并实现更紧凑的生成。
点评