NeFut Logo NeFut
EN 管理员登录

[AI学术] 黑盒LLM对话中的约束影响:测量和恢复

发布于:2026-08-14 22:00 最后更新:2026-08-16 07:03
#Machine Learning #LLM #Artificial Intelligence

黑盒LLM对话中的约束影响

在多轮对话中,用户可以轻松地添加或撤销约束,但是撤销并不总是生效:模型继续执行已经撤销的要求,这种现象被称为行为回归或撤销惯性。现有的方法无法测量每个约束的影响,预测其行为,也无法在匹配的预算下修复它。

sysname{}系统

sysname{}系统通过以下三个步骤来解决这个问题:

  1. 约束账本:每个约束都与一个可执行的检查器配对,撤销记录为墓碑,并在事先将净约束状态编译为单个规格。
  2. 顺序消除探测:测量每个约束的遵守性和行为效果。
  3. 修复梯度:在令牌和尝试匹配的预算下操作。 在dataname{}数据集上,使用NTasks{}个HumanEval任务和NClauses{}个已验证的检查器,行为回归在8B操作点上随着约束负载的增长而增加,而更强大的模型则保持在底部。在匹配的检查器、模型和预算下,事先编译显著减少了回归。 博主点评: 本文提出的sysname{}系统能够有效地测量和恢复黑盒LLM对话中的约束影响,这是一个重要的研究成果。通过使用约束账本、顺序消除探测和修复梯度,sysname{}系统能够预测和修复行为回归,提高了LLM对话的可靠性和安全性。
原文链接: https://arxiv.org/abs/2608.12599

[h] 返回首页