摘要
企业代理必须遵循长期、条件性和安全关键的标准操作程序(SOP)。我们将机器可读的SOP约束编译成可执行的伪代码,并使用程序引导(PG)堆栈机器运行它们,同时让LLM进行语义执行。通过对六个模型的三臂SOPBench研究,分离了表示与运行时:编译文本从未显著受损,并在官方文本表现不佳时获得高达16.0分的提升。运行时指导是能力门控的。两个强模型分别显示出在七个领域的积极PG对比(58:19 和 75:31 的不一致对),而弱模型则受到损害。完整程序游标消融(先激活帧,保留完整程序)恢复了强模型拒绝增益的大部分;选择性可见性带来了较小的改善。配对探测和审计测量跟踪这个差异,表明这是自发状态纪律而非重建能力的结果。在Bank上,三个主要臂的分数从70.4上升到86.4,再到92.8,拒绝正确率达到100%。
实践指导
首先进行编译;仅在模型级别纪律检查后启用活动帧分页。
博主点评: 本文提出了一种创新的方法,通过编译SOP并结合PG堆栈机器来优化LLM的执行效果。研究结果显示,能力门控的运行时指导不仅提升了强模型的表现,也为模型的训练和应用提供了新的思路,尤其是在安全关键的领域中。有效的程序设计与执行策略的结合,显著提高了系统的整体性能。