NeFut Logo NeFut
EN 管理员登录

[AI学术] 法定 AI:让大语言模型遵循法律规范

发布于:2026-09-02 22:00 最后更新:2026-09-03 02:56
#AI #Machine Learning #LLM

随着 AI 监管框架的不断完善,确保生成式模型遵守法律与伦理已成关键任务。现有的对齐方法存在局限:宪法 AI 依赖人工监督,"为人类福祉"(GfH)等宽泛原则过于抽象,难以提供可操作的治理指引。为此我们提出 Statutory AI,利用已有的人类撰写法律文本作为宪法层级框架,使模型能够自主依据既定规范批判并修正输出。

Statutory AI 采用两阶段 Chain-of-Thought 提示。第一阶段将用户请求归类到预定义的法律主题;第二阶段结合该主题下选取的法律条文,对请求进行分析并生成符合规范的答案。

我们在 1,000 条红队攻击提示上进行实验,覆盖歧视、泄露机密、暴力、欺诈、虐待弱势群体五大惩罚性主题。结果显示,Statutory AI 将有害内容削减 52%~59%,比标准宪法 AI 高约 10 个百分点,同时计算时间缩减超过 50%。

点评

原文链接: https://arxiv.org/abs/2608.28593

[h] 返回首页