LLM 驱动的代理在执行多步任务时会留下长而无结构的行为轨迹,这使得安全审计和运行时监控变得困难。现有方法往往只关注单条轨迹或仅在成功案例上建模,因而忽略了跨运行的拓扑结构——即能够同时支撑下一步预测和失败预测的共享模式。为了解决这一问题,我们将整个轨迹语料库压缩为一棵紧凑的有限状态机(FSM),该 FSM 充当 LLM 代理行为的结构基底。
在十二个公开数据集上,构建的 FSM 规模仅为 7 到 43 个状态,能够以 0.997 的适配度重放持出数据,且在不同数据划分间保持几乎相同的拓扑结构,构建时间仅为毫秒级。该结构同时服务于两类预测任务。对于下一步预测,使用 FSM 状态作为上下文的模型在所有与真实标签匹配的数据集上均优于 Agent Workflow Memory。对于失败预测,基于每个状态的行为特征在持出数据上实现最高 0.94 的 AUROC,并且在线监控能够在部分轨迹阶段就将失败运行排在通过运行之前,从而实现提前终止。
实验表明,行为拓扑更多地受到部署框架的影响,而非底层 LLM 本身,这为安全审计和运行时监控提供了一种模型无关的结构原语。
博主点评:该工作展示了通过 FSM 抽象捕获跨运行行为模式的潜力,为 LLM 代理的可解释性和安全性提供了实用工具,值得在实际部署中进一步探索。