随着AI监管框架的不断完善,确保人工智能系统尤其是生成模型遵循法律和伦理标准已成关键任务。现有的AI对齐方案存在局限:宪法式AI依赖人工监督,广义的“对人类有益”原则过于笼统,难以提供可操作的治理指引。为克服这些问题,本文提出“法定AI”,利用法律文本中已有的人类编写原则作为宪法框架,使模型能够自主依据既定规范批判并修正输出。方法分两阶段,均采用链式思考提示。第一阶段将用户请求归类到预定义的法律主题;第二阶段结合该主题对应的法律条文,对请求进行分析并生成符合规范的回答。实验使用1000条红队提示,覆盖歧视、泄露机密、暴力、欺诈、危害弱势群体五个惩罚性主题。结果显示,法定AI在所有测试模型上将有害内容降低52%~59%,比标准宪法式AI高约10个百分点,同时计算时间缩减超过50%。
博主点评:该工作展示了将法律文本直接嵌入模型对齐流程的可行性,兼顾可解释性和效率,为未来的合规AI提供了有价值的思路。