NeFut Logo NeFut
EN 管理员登录

[AI学术] 预算边界对测试时数学推理的影响

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

在数学推导过程中,累计 token 上限可能恰好落在推理的中间位置,导致测试时的控制器必须在 严格停止(在上限处截断)和 建议继续(让当前尝试完成)之间做出选择。我们通过对 19,200 条公开轨迹的离线配对回放来衡量这种边界选择的影响,实验包括 120 道 AIME、BrUMO 与 HMMT 题目,以及同一模型的两套存档配置。实验固定候选答案的顺序和 16 次尝试的上限,答案选择过程对参考答案和正确性标签保持盲目。

主要发现:

  1. 在 4k token 上限下,大多数建议继续带来的准确率提升来源于将原本的放弃(abstention)转化为正确答案;严格停止则因为截断了未完成的前缀而失去本可以被仅完成答案选择器利用的信息。
  2. 按实际消耗的成本比较时,结果与同上限的直接比较不同:在低预算情形下,建议继续的 4k 上限在相近的平均完成成本下的准确率高于严格停止的 8k;而在高预算情形下,其观察到的准确率比严格停止的 32k 低 0.42 个百分点,却只使用了 59% 的平均 token。此类整体比较并不能证明等算力下的优越性或准确率等价。
  3. 候选答案覆盖率的提升并不必然带来更高的答案准确率:在覆盖率上升的同时,基于对数概率的选择器出现了准确率下降的现象,即使在进行来源级一致性修复后亦是如此。相同上限下,多数投票的准确率差距在 32k 时已收窄至 1.3% 以下。

建议:在报告预算曲线时应同时给出上限、实际消耗、可选候选数量、停止规则以及选择器的具体信息。

点评

原文链接: https://arxiv.org/abs/2609.38699

[h] 返回首页