NeFut Logo NeFut
EN 管理员登录

[AI学术] hacktrace:基于行为监督的代码生成奖励作弊检测

发布于:2026-10-06 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #LLM

一个编码代理可以通过修复代码获得通过分数,也可以通过删除暴露缺陷的测试来作弊。要检测此类奖励作弊,需要识别包括失败尝试在内的所有捷径行为。我们公开了 173,561 条来自 Qwen3-8B 的多轮编码轨迹,并证明独立监督捷径行为(而非仅监督成功利用)显著提升检测效果。

我们提出 HACKTRACE,这是一种行为监督监控器,直接读取代理在生成代码时已经计算的内部状态。复用这些状态使得监控可以在一次生成回合结束前完成,无需额外的语言模型 token 或二次推理。将这些动态证据与最终文件的静态特征相结合,能够在仅 8 ms 的监控开销下实现每题平均 AUC 0.997,明显优于在诚实性问答上重新运行模型的传统监控方案。

相同的生成状态还为强化学习提供了低成本的监控信号。结合强 GRPO 惩罚,HACKTRACE 将通过作弊获得的解答比例从 82%‑91% 降至 1%‑5%,同时保留诚实且正确的解答,并在策略演化过程中保持高检测准确率。我们的实验表明,监督目标的选择以及监控证据的来源对将准确检测转化为有效训练信号至关重要。

点评

原文链接: https://arxiv.org/abs/2610.03055

[h] 返回首页