NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过递归自我改写实现复杂任务的轨迹扩展

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

我们提出递归自我改写(Recursive Self‑Rewrite,RSR)框架,使用单一基座模型 Qwen‑3.8‑27B 在多种专用 harness 下发现成功解法,并将其重构为通用 harness 下的训练轨迹。RSR 包含三大模块:规划器负责将成功解法抽取为可执行的 runbook;评审器检测验证器和解答泄漏,并引导递归修订;执行器在全新沙箱中运行合格的 runbook。实验在约 3000 条自建终端任务上进行,三种 harness 共同解决了 759 条任务,比记录池中最强单一 harness 多出 34.3%。RSR 将 2001 条成功源轨迹扩展为 11094 条重写轨迹用于监督微调。基于这些轨迹的微调在多项基准上显著超越基座模型和直接轨迹 SFT:Terminal‑Bench 2 的 pass@3 从 57.0% 提升至 74.2%,Terminal‑Bench 4 从 1.5% 提升至 9.1%,自建 Hard 集合从 39.0% 提升至 63.0%,Software 集合从 3.0% 提升至 6.0%。长时程 Terminal‑Bench 的过程奖励从 0.21 上升至 0.29。结果表明,多样化的 harness 辅助经验可以被重构为模型在通用 harness 下可复用的能力。

点评:RSR 展示了通过统一轨迹重写提升模型通用性和性能的可行路径,为未来的自监督任务学习提供了新思路。

原文链接: https://arxiv.org/abs/2610.02826

[h] 返回首页