NeFut Logo NeFut
EN 管理员登录

[AI学术] MASCRDM:大语言模型训练过程中的合规风险检测与缓解多智能体系统

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

大型语言模型(LLM)已广泛应用,但其合规性与安全性仍是难点,尤其是歧视和偏见问题。现有方法多聚焦于训练后对输入输出的过滤,缺乏对模型内部结构的实时监控。我们在分析 LLM 训练流程后发现两大不足:一是检测手段主要是静态的,仅能实现局部优化;二是缺乏贯穿全流程的实时风险识别与缓解,导致灵活性受限。为此我们提出 MASCRDM(Multi‑Agent System for Compliance Risk Detection and Mitigation),在训练阶段引入多智能体协同工作。首先,依据 AI 法律法规构建合规规则,并在合规专家指导下训练专用的合规 LLM。随后,将 LLM 拆解为若干模块,利用合规知识图谱定位关键节点。训练过程中,多个智能体持续监测这些节点,实时给出风险预警并提供改进建议。实验在歧视与偏见基准上验证,MASCRDM 能在保持语义性能的前提下显著提升合规水平,展示了从模型内部系统性降低合规风险的可行路径。

点评

原文链接: https://arxiv.org/abs/2609.39107

[h] 返回首页