摘要
多智能体 LLM 框架通常在启动时就固定了团队拓扑。当某个智能体在运行时负荷过重,例如混合了过多的动作类别、积累了工具错误,或在过多调用后排队时,系统缺乏重构机制。
我们提出了自主拓扑变迁(ATM),这是一个为多智能体 LLM 框架设计的运行时团队变换机制。ATM 结合了基于遥测的过载检测与三种安全不变量来控制结构变更:能力单调性、状态路由完整性和影子验证优先于实时验证。
ATM 监控一个六信号瓶颈指数,包含队列深度、上下文抖动、工具错误率、角色熵、重试循环率和跨智能体等待时间。当温启动校准阈值在多个连续的时间点被突破时,ATM 将过载的智能体分解为专门的子智能体,并将父智能体热插拔为协调者角色,同时保留其外部身份。
状态转移通过隐私级别感知路由进行控制:每个内存原子仅被路由到允许的子集,或被显式丢弃并记录原因。任何候选拓扑在经过影子验证窗口之前都不会接收实时流量。
在720次 DeepSeek-V3 驱动的任务运行中,经过四种消融条件和三种工作负载的测试,ATM 分解器的代码任务成功率从 3.3% 提升至 61.7%。完整的铁路和蒸馏系统在正则表达式分类器下将高隐私内存暴露事件从每个任务的 2.0 降至 0.0,同时保持任务质量。运行时轨道承载 ATM 的不变量在智能体热路径上增加的延迟不超过 500 微秒。
同时,包含一个小型实时工具探测器与真实 Python 执行作为外部有效性检查。该实现、基准测试工具和追踪记录均已开源。
博主点评: ATM 提出了一个创新的解决方案,通过动态重构机制增强多智能体 LLM 系统的可靠性和效率。这种方法不仅提升了任务成功率,也有效降低了隐私风险,显示出在复杂环境中智能体系统的自适应能力。未来,如何进一步优化性能与安全性将是研究的重点。