在大型语言模型(LLM)代理日益依赖持久共享内存进行协调的背景下,一个代理的写入成为另一个代理的前提,最终可能导致具有实际副作用的工具调用。目前的代理内存系统将每一个接受的写入视为立即可执行的真理,这使得污染的工具结果、过时的更新或队友未完成的笔记可能导致不可逆转的操作。
我们认为,内存写入并不等同于信念提交。为此,我们提出了 MemTX,这是一个事务性信念提交协议。每条记录都携带证据、权限、来源和有效性。写入操作在快照隔离的事务中进行,并通过验证-提交管道进行处理;不可逆的工具调用受到正在进行的信念状态的限制,而撤回信念则触发与其派生记录和工具副作用相关的类型化级联修复。
两个不变式,操作安全门控和级联修复完整性,通过基于属性的测试和对 550 万个协议状态的有界穷举检查进行机器验证,且未发现任何违规行为。在来自三种模型系列的五个基础设施上,MemTX 在八个基准测试中表现优异,在四个基础设施上与配对的 McNemar 测试具有显著性,而在第五个最强的基础设施上与最佳基准统计上持平,同时也是唯一在每个基础设施上都没有下游损害的方法。这表明,基础设施能力并不能替代提交纪律。
博主点评: MemTX 的提出为状态代理内存的事务性管理提供了重要的理论基础和实用框架,标志着内存写入逻辑的重大进步。通过引入验证和级联修复机制,MemTX 不仅提升了操作的安全性,也增强了系统的健壮性,值得在实际应用中深入探索与验证。