NeFut Logo NeFut
EN 管理员登录

[AI学术] DiagEvo:基于层次错误记忆的诊断引导自我进化

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

自我对弈是语言模型自我进化的有效范式,但缺乏指导时,求解器的性能往往在多轮后出现停滞或下降。传统的无指导方法会依据难度、可学习性或多样性等信号生成问题,这些信号虽能保持题目挑战性,却未指明后续轮次应聚焦的推理薄弱环节。受限于外部任务资源(如人工示例、文档库或预设难度目标)的有指导方法则需要额外信息输入。

我们提出 DiagEvo,其核心思想是直接从求解器的失败历史中提取进化方向。诊断器从错误日志中抽取重复出现的错误原因,并将其存入层次错误原因记忆。记忆结构将相关原因归类到技能节点下,并根据在针对性问题上的自洽性将每个原因标记为 Active(活跃)或 Mastered(已掌握)。

挑战器依据这些状态以及出现次数,在针对性生成自由探索之间进行平衡。双置信过滤机制仅保留中等难度的问题——即当最常见的求解器答案拥有明显投票优势时才接受该题目。整个课程表完全来源于自我对弈过程,无需外部任务资源。

实验使用默认的 4B 诊断器,在九个基准上对三种求解器(Qwen3‑4B、Qwen3‑8B、OctoThinker‑8B)均实现最高平均准确率。对 Qwen3‑8B 而言,在五个数学推理基准上达到 72.3% 的平均准确率,领先 R‑Zero 4.5 个百分点;在全部九个基准上平均准确率为 57.4%,比 DARC 高出 1.1 个百分点。消融实验表明,层次错误原因记忆和双置信过滤均对性能提升有显著贡献。

点评:DiagEvo 通过内部错误记忆实现了自洽的自我进化路径,摆脱了对外部标注的依赖,在多模型、多任务上展现出稳健的提升效果。

原文链接: https://arxiv.org/abs/2609.00768

[h] 返回首页