NeFut Logo NeFut
EN 管理员登录

[AI学术] 代码监控红队:揭示公共测试隐藏的缺陷

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #optimization

摘要

可见测试是 LLM 生成代码的常见门槛,但通过这些测试并不能证明规范的正确性。我们研究了一种类似于部署的监控问题:在代码通过公共测试后,是否可以通过一个较弱的 LLM 验证器识别残留的隐藏漏洞?

我们引入了代码监控红队(Code Monitor Red Teaming),这是一种监控-红队协议,旨在修复公共检查信息边界,同时调整生成器压力、验证器框架,以及弱到强的能力。

我们将其实例化为 CodeMonitorBench,涵盖函数级、数据科学和工作流代码。在 71,000 个生成候选中,43,677 个通过公共测试,而其中 23,081 个在隐藏测试中失败。弱验证器在框架和模型家族的帮助下有所改进,但仍然在 5% 的假阳性率下错过大部分隐藏漏洞。作为一种稳健性压力测试,针对公共测试过拟合的对抗性压力降低了验证器的 AUROC,并在大多数单元中提高了低假阳性遗漏率。使用 GLM-5.1 验证器在相同的证据边界下部分弥补了这一差距;可推导性审计显示,剩余的遗漏将验证器失败与 M1 证据限制混合在一起。

博主点评: 本文提出的代码监控红队方法是对 LLM 生成代码质量控制的重要探索,通过引入隐藏测试来评估验证器的有效性,为未来的代码验证提供了新的思路。监控与红队结合的策略,可以有效识别潜在的代码缺陷,值得在实际应用中深入研究。

原文链接: https://arxiv.org/abs/2607.20852

[h] 返回首页