大型语言模型(LLM)代理正日益在同一循环中融合生成、决策、执行和自评。它们虽受任务指令、指南、输出模式和可复用技能等外部规范约束,但这些规范往往仅是同一模型的上下文,缺乏独立的规范权威边界。于是出现两类缺口:
- 理解‑执行缺口:模型理解了需求,却未在执行中满足。
- 状态‑权威缺口:模型的解释或完成声明未能建立所需的状态。
在 SkillsBench 上,仅使用代理可见的提示、工作区信息和注入的技能规范,我们抽取了 509 条来源可追溯的任务指令。七种模型的满足率仅为 79.6%‑86.4%,而完成声明率比官方评估通过率高出 28.7‑37.9 个百分点。
因此我们将代理的提案与权威状态分离。代理可以规划、行动并请求完成,但只有来自合格提供者的可采纳证据才能确立规范治理的状态。SpecHarness 将可见规范编译为来源关联的义务,并通过版本化的义务状态管理执行与收尾。可验证的需求在运行时被调解或验证,模糊或主观的需求则保持建议性质。实验表明,规范不仅是行为指引,更可成为合规执行与完成的权威。
点评