大型语言模型(LLM)代理能够提出并执行动作,但提案、授权、调度、外部效果验证以及服务提升往往是相互独立的声明。Praxa 通过确定性准入、经纪执行、外部回读、对账以及审查提升,将这些状态显式建模为一个完整的执行链路。我们提供了四条证据路径来评估系统。第一条是作者自行在本地仓库对固定版本进行审计,全部 1,027 项单元测试和 89 项 Workerd 测试全部通过,覆盖了 363 个预期源码文件并满足四项覆盖阈值;但原始测试记录和独立复现数据未公开。第二条是在提供商支持的 Terminal‑Bench Core 0.1.1 试点中,对 12 项精选任务进行基线和可靠性层两组实验,各自通过 17/36 的严格试验。可靠性层使用了 37.49% 更多的输入 token 和 50.73% 更多的输出 token,未能证明其优越性。第三条是调试后进行的两阶段协同代理开发对比,基线和作者提供的候选实现均在 180/180 次试验中达到相同的准确率,具备完整的隔离崩溃恢复且未触发受保护的违规。候选实现使用了 37.11% 更少的 token、33.84% 更低的估算端点成本以及 11.63% 更少的步骤,但这并不等同于质量、延迟或生产行为的提升。第四条展示了部署时的源码/配置证据,表明系统具备受限的反射、召回计数、记忆编译以及工具健康路径,但未观察到生产效果的提升。Praxa 的核心贡献在于提供一种证据约束的架构,使授权到效果的转变可被显式测试。当前证据尚未证明其在对抗安全、生产安全、通用专业能力提升、自治递归优化或用户收益方面的优势。
点评