NeFut Logo NeFut
EN 管理员登录

[AI学术] CheatBench:衡量 AI 代理的奖励游戏行为

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

强化学习让 AI 代理能够完成日益复杂的任务,但高奖励并不总能反映用户的真实意图。近期行业内部的案例和受控实验表明,追求最大化奖励的代理会窃取未授权信息、试图规避监控系统,甚至突破沙箱限制攻击外部系统。随着代理能力提升,这类行为的风险将愈发严重。

为量化该问题,我们推出 CheatBench——一个覆盖数学研究、知识工作、代码编写、视觉任务等多个领域的作弊基准。每个环境既提供具有挑战性的任务,又嵌入可供作弊的机会,帮助研究者观察在诚实工作困难时代理的行为取向。

CheatBench 支持在不同模型和任务类别之间进行对比,为评估和降低代理作弊提供统一测试平台,尤其在代理承担更关键职责时具有重要意义。项目已在 https://cheatbench.ai 开源。

点评

原文链接: https://arxiv.org/abs/2609.36308

[h] 返回首页