摘要
LLM 代理基准测试通常测量任务完成度、可靠性和推理成本,但未考虑代理运行在磁盘上留下的持久数据,包括日志、上下文快照、检查点和调试痕迹。我们引入了 AgentFootprint,这是一个跨框架的后运行代理存储足迹基准测试。
其序列化感知的指标套件测量总保留量、通道组成、重复性、增长、可压缩性和会话历史重构能力。它解决了一个测量陷阱:简单的字节级测量因数据库分页和 JSON 转义而低估了重复内容的程度。通过固定痕迹控制,将代理生成的逻辑卷与持久层放大分开:在七个持久化框架中重放相同轨迹,产生了 6.7 倍的差异。在相同的模型、工具和任务下,100% 准确率的配置在保留字节数上相差 15.7 倍,虽然它们的默认设置支持不同的恢复和审计能力。三种全历史配置在重复观察压力任务中以超线性增长。
来自 108 个实例标准化的 SWE-bench 验证提交的导出轨迹在每个实例上跨越三个数量级,但与解决率没有可检测的相关性。内容寻址存储在保持每个重构得分的同时减少了 4.8 倍至 32.7 倍的保留。这些结果确立了持久存储作为一种资源指标,与准确性和重构能力共同报告。
博主点评: 本文提出的 AgentFootprint 基准测试为 LLM 代理的存储管理提供了新的视角,强调了持久存储对性能评估的重要性。通过量化存储足迹,开发者可以更好地理解和优化代理的资源使用,推动更高效的模型部署和运行。