摘要
可见测试是 LLM 生成代码的常见门槛,但通过这些测试并不能证明规范的正确性。我们研究了一种类似于部署的监控问题:在代码通过公共测试后,是否可以通过一个较弱的 LLM 验证器识别残留的隐藏漏洞?
我们引入了代码监控红队(Code Monitor Red Teaming),这是一种监控-红队协议,旨在修复公共检查信息边界,同时调整生成器压力、验证器框架,以及弱到强的能力。
我们将其实例化为 CodeMonitorBench,涵盖函数级、数据科学和工作流代码。在 71,000 个生成候选中,43,677 个通过公共测试,而其中 23,081 个在隐藏测试中失败。弱验证器在框架和模型家族的帮助下有所改进,但仍然在 5% 的假阳性率下错过大部分隐藏漏洞。作为一种稳健性压力测试,针对公共测试过拟合的对抗性压力降低了验证器的 AUROC,并在大多数单元中提高了低假阳性遗漏率。使用 GLM-5.1 验证器在相同的证据边界下部分弥补了这一差距;可推导性审计显示,剩余的遗漏将验证器失败与 M1 证据限制混合在一起。
博主点评: 本文提出的代码监控红队方法是对 LLM 生成代码质量控制的重要探索,通过引入隐藏测试来评估验证器的有效性,为未来的代码验证提供了新的思路。监控与红队结合的策略,可以有效识别潜在的代码缺陷,值得在实际应用中深入研究。