NeFut Logo NeFut
EN 管理员登录

[AI学术] ArgGYM:结构化可撤销推理的程序化、引擎验证基准

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#Machine Learning #LLM #Artificial Intelligence

近期,大语言模型在数学、代码和形式逻辑等领域的推理能力提升,主要得益于可自动验证奖励的基准和强化学习环境。这类设置让模型的准确性更易评估和优化,但在固定问题规格和稳定评估标准下的成功能否迁移到更广泛的推理场景仍不明确。真实世界的推理常在信息不完整且可修正的条件下进行:结论可能暂时成立,被反例推翻后再被恢复,或在出现更强理由时被重新评估,这类推理被称为可撤销推理。

我们推出 ArgGYM——一个面向结构化可撤销推理的程序化基准和兼容 RLVR 的训练环境。ArgGYM 将该推理过程拆解为十二个子任务,并使用符号论证引擎计算形式化状态,以此为模型输出提供任务特定的评分依据。基准包含 1,440 条经验证的冻结实例,覆盖十五种课程配置,并提供两种论证偏好序(最弱链、最后链)和两种集合序(精英式、民主式)。同一套生成器和验证器还能动态生成新实例,用于评估和可验证奖励的训练,从而降低对静态测试集的依赖。

在冻结基准上,前沿模型和开放权重模型表现出显著不同的推理特征:它们能够在未完整解决任务的情况下恢复结构化答案的较大部分,但随着课程配置的推进——依赖链更长、结构交互更复杂——性能出现明显下降。我们已公开基准、生成器和验证器,以支持可复现的评估和 RLVR 训练。

点评

原文链接: https://arxiv.org/abs/2609.38409

[h] 返回首页