NeFut Logo NeFut
EN 管理员登录

[AI学术] 谁握笔?让规范而非代理签署

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

大型语言模型(LLM)代理正日益在同一循环中融合生成、决策、执行和自评。它们虽受任务指令、指南、输出模式和可复用技能等外部规范约束,但这些规范往往仅是同一模型的上下文,缺乏独立的规范权威边界。于是出现两类缺口:

在 SkillsBench 上,仅使用代理可见的提示、工作区信息和注入的技能规范,我们抽取了 509 条来源可追溯的任务指令。七种模型的满足率仅为 79.6%‑86.4%,而完成声明率比官方评估通过率高出 28.7‑37.9 个百分点。

因此我们将代理的提案与权威状态分离。代理可以规划、行动并请求完成,但只有来自合格提供者的可采纳证据才能确立规范治理的状态。SpecHarness 将可见规范编译为来源关联的义务,并通过版本化的义务状态管理执行与收尾。可验证的需求在运行时被调解或验证,模糊或主观的需求则保持建议性质。实验表明,规范不仅是行为指引,更可成为合规执行与完成的权威。

点评

原文链接: https://arxiv.org/abs/2609.29921

[h] 返回首页