NeFut Logo NeFut
EN 管理员登录

[AI学术] 编译优先:为程序化LLM代理构建可执行的标准操作程序

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#algorithm #LLM #Open Source

摘要

企业代理必须遵循长期、条件性和安全关键的标准操作程序(SOP)。我们将机器可读的SOP约束编译成可执行的伪代码,并使用程序引导(PG)堆栈机器运行它们,同时让LLM进行语义执行。通过对六个模型的三臂SOPBench研究,分离了表示与运行时:编译文本从未显著受损,并在官方文本表现不佳时获得高达16.0分的提升。运行时指导是能力门控的。两个强模型分别显示出在七个领域的积极PG对比(58:19 和 75:31 的不一致对),而弱模型则受到损害。完整程序游标消融(先激活帧,保留完整程序)恢复了强模型拒绝增益的大部分;选择性可见性带来了较小的改善。配对探测和审计测量跟踪这个差异,表明这是自发状态纪律而非重建能力的结果。在Bank上,三个主要臂的分数从70.4上升到86.4,再到92.8,拒绝正确率达到100%。

实践指导

首先进行编译;仅在模型级别纪律检查后启用活动帧分页。

博主点评: 本文提出了一种创新的方法,通过编译SOP并结合PG堆栈机器来优化LLM的执行效果。研究结果显示,能力门控的运行时指导不仅提升了强模型的表现,也为模型的训练和应用提供了新的思路,尤其是在安全关键的领域中。有效的程序设计与执行策略的结合,显著提高了系统的整体性能。

原文链接: https://arxiv.org/abs/2607.11346

[h] 返回首页