随着 AI 监管框架的不断完善,确保生成式模型遵守法律与伦理已成关键任务。现有的对齐方法存在局限:宪法 AI 依赖人工监督,"为人类福祉"(GfH)等宽泛原则过于抽象,难以提供可操作的治理指引。为此我们提出 Statutory AI,利用已有的人类撰写法律文本作为宪法层级框架,使模型能够自主依据既定规范批判并修正输出。
Statutory AI 采用两阶段 Chain-of-Thought 提示。第一阶段将用户请求归类到预定义的法律主题;第二阶段结合该主题下选取的法律条文,对请求进行分析并生成符合规范的答案。
我们在 1,000 条红队攻击提示上进行实验,覆盖歧视、泄露机密、暴力、欺诈、虐待弱势群体五大惩罚性主题。结果显示,Statutory AI 将有害内容削减 52%~59%,比标准宪法 AI 高约 10 个百分点,同时计算时间缩减超过 50%。
点评