大型语言模型(LLM)已广泛应用,但其合规性与安全性仍是难点,尤其是歧视和偏见问题。现有方法多聚焦于训练后对输入输出的过滤,缺乏对模型内部结构的实时监控。我们在分析 LLM 训练流程后发现两大不足:一是检测手段主要是静态的,仅能实现局部优化;二是缺乏贯穿全流程的实时风险识别与缓解,导致灵活性受限。为此我们提出 MASCRDM(Multi‑Agent System for Compliance Risk Detection and Mitigation),在训练阶段引入多智能体协同工作。首先,依据 AI 法律法规构建合规规则,并在合规专家指导下训练专用的合规 LLM。随后,将 LLM 拆解为若干模块,利用合规知识图谱定位关键节点。训练过程中,多个智能体持续监测这些节点,实时给出风险预警并提供改进建议。实验在歧视与偏见基准上验证,MASCRDM 能在保持语义性能的前提下显著提升合规水平,展示了从模型内部系统性降低合规风险的可行路径。
点评