随着编码代理从监督式代码补全转向无人值守、全天候的探索,它们的工作不再是孤立的预测,而是包含推理、工具使用和反馈的长序列。因而 token 效率 成为递归自我改进可扩展性的关键。我们在 harness 层采用受 RSI 启发的方法,将自动研究循环扩展到数量和多样性均显著提升的环境中进行 roll‑out。大规模实验表明,这一过程能够产生可复用的改进,能够迁移到开发环境之外,使自动 harness 发现向生产级别迈进。经过选择的四个机制构成了 SoL‑Pi:
- 动作执行(Action Execution)
- 上下文压缩(Context Compaction)
- 观察处理(Observation Handling)
- 委托阅读(Delegated Reading)
在 51 项 EdgeBench 基准上,SoL‑Pi 的表现与使用 GPT‑5.6 Sol 与 Opus 5 的 Pi 相当,但记录的 token 流量降低了 44.7%–49.0%,API 成本约下降三分之一。换算成每小时费用,SoL‑Pi 相比原生 Codex 与 Claude Code harness 可节省 $8.75–$13.50,相比 Pi 可节省 $4.36–$5.71。
点评:SoL‑Pi 展示了在大规模环境中通过递归自研循环实现 token 与成本双重优化的可行路径,为下一代高效编码代理提供了实用蓝图。