摘要
当前的大型语言模型(LLM)智能体面临尴尬的境地。当它们被静态安全指令束缚时,往往只能停留在显而易见的方案上;而一旦自由使用工具和进行多智能体辩论,安全违规问题便接踵而至。为了解决这一矛盾,我们提出将不同的任务分配给专门的角色,而不是强迫单一模型兼顾创造力与谨慎。
在我们的框架中,Disrupter 负责生成非常规提案,Validator 则在工具入口处执行严格的运行时检查,Broker 则引入相关的远程类比。失败的案例不会被丢弃,而是通过蒙特卡洛树搜索(MCTS)进行编译,形成我们称之为Scars的紧凑签名约束补丁。这些补丁被本地缓存,并被未来的智能体群体继承,使得重复的失败转化为可重用的低成本运行时约束。
在一个空间-语义的沙盒环境中(N=20次运行,p=0.05),我们验证了这一方法的有效性。通过这种方式,智能体能够在保持安全的同时,进行更多的创造性探索。
博主点评: 这一研究通过角色分离有效解决了LLM在创造性与安全性之间的矛盾,利用运行时约束记忆提升了智能体的探索能力,具有重要的理论与实践意义。