NeFut Logo NeFut
EN 管理员登录

[AI学术] ReSolve:通过选择性生成式调节复用候选推理

发布于:2026-10-03 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

采样多个解会在中间推导和未完成论证上消耗计算,最终答案也会被浪费。为此我们提出 ReSolve,一种无需额外训练的推理流程,利用选择性生成式调节复用已有候选推理。核心是答案分布控制器:当候选答案不一致或缺乏可解析的结果时,控制器让模型检查现有推导,并将生成的解加入一个有界循环中。

在 130 道竞赛数学题上使用 Hybrid 评分,对两组独立抽样的候选池进行评估。ReSolve 在第一组得到 100 题全对,第二组 99 题全对;对应的四候选投票分别为 91 和 92 题正确,且没有出现投票正确转为错误的情况。

八样本自一致性方法得到 94 与 96 题正确,但消耗的 token 明显更多;ReSolve 的 token 使用分别降低 46.3% 和 47.2%。

受控消融实验去除可见推导,仅保留答案键、投票计数和每状态输出上限规则,准确率从 100 降至 93,计算量却增加。

在选择性和始终开启的 Uniform 调节下均能解出 97 题;相较于全局调节,选择性降低约 54% 的调节 token,并使整体流水线 token 减少 6.2%。

这些结果表明候选推理可以作为可复用的推理计算,但并未证明相较于更多采样或专门的路线指令能获得额外的准确率提升。

点评

原文链接: https://arxiv.org/abs/2610.01140

[h] 返回首页