NeFut Logo NeFut
EN 管理员登录

[AI学术] SBCO:自监督、验证器基础的整体优化方法

发布于:2026-08-12 22:00 最后更新:2026-08-13 01:53
#Machine Learning #optimization #Artificial Intelligence

最近,研究人员提出了像达尔文·哥德尔机和赫胥黎·哥德尔机等方法,这些方法通过自我参考实现了开放式的自我改进。然而,这些自我参考的自我改进方法需要任务的能力与自我修改的能力相一致。在不满足这种一致性的情况下,研究人员提出了SBCO(自监督块坐标优化器)方法。SBCO是一种自监督的、验证器基础的优化方法,通过近似的块坐标上升法学习一个分解的验证器银行和一个马具策略,改进代理的输出。实验结果表明,SBCO在两个领域中匹配或超过了自定义的自我修改基线,同时使用了4-5.5倍较少的计算预算。 博主点评: SBCO方法为代理的自我改进提供了一种新的思路,通过自监督学习和验证器基础的优化,实现了代理的高效改进。这种方法在减少计算预算的同时,取得了不错的实验结果,值得进一步研究和应用。

原文链接: https://arxiv.org/abs/2608.10157

[h] 返回首页