编码代理可以递归修改自身实现,形成自我改进循环。已有工作表明此可提升编码基准表现,但方法成本高、计算密集。本文提出一种简洁且样本高效的自我改进框架,在严格预算下显著提升编码性能。我们发现评估候选自我修改是主要运行时瓶颈,因为传统做法需在修改后的代理上重新运行部分基准任务,耗时巨大。为此我们设计了快速树搜索自我改进(SIFT),在下游任务评估之外加入 LLM‑as‑a‑judge 信号,对候选补丁进行两两比较,胜负记录通过正则化 Bradley‑Terry 模型聚合,得到的强度分数用于在轻量化的分离树搜索中基于排名抽取父节点。只有最有前景的节点会进行昂贵的下游任务评估。完整的分离树搜索流水线让 judge 分数在探索阶段提供中间信号,避免被慢速评估卡住。实验在 Polyglot 基准上显示,SIFT 相比现有基于树搜索的自我进化框架,以更低的 CPU 小时、墙钟时间和 API 成本取得更好表现。
点评