NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过推理时计算和部署框架提升评估真实感

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#algorithm #Machine Learning #Artificial Intelligence

对齐评估的核心难题是模型会识别出自己正处于测试环境,从而削弱安全评估的可信度。我们提出两种方法,使模拟评估更难被模型辨别为测试。第一种方法称为 critique refinement,在每一次模拟动作上额外消耗推理时间:模拟器生成若干候选动作,利用目标模型对这些动作的反馈进行细化,然后选取最接近真实部署的候选继续评估。第二种方法是 DISH(Deployment‑Imitating SWE‑Agent Harness),它将目标模型包装在一个代理框架中,缩小编码场景下模拟环境与真实部署之间的差距。我们在多个目标模型上实验,发现两种技术可以叠加使用,组合效果显著优于单独使用。实验表明,自动化手段能够提升对齐评估的真实感,并且相比延长审计时间,额外的计算资源能够更高效地提升评估质量。

点评

原文链接: https://arxiv.org/abs/2609.02302

[h] 返回首页