NeFut Logo NeFut
EN 管理员登录

[AI学术] 策略即技能:基于证据、确定性控制与审计的受治理 LLM 决策支持

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

组织越来越多地使用大语言模型(LLM)来支持政策、合规、风险和运营决策,这要求系统能够对模型输出的证据进行验证、将结果路由至审查人员、实现版本控制并保持可审计性。为此我们提出了 Policy-as-Skill(PaS),一种模块化运行时框架,将这些治理功能封装为可执行、可版本化的策略能力。PaS 通过统一的接口将证据校验、审查路由、策略引用和审计记录等子模块组合在一起,形成完整的决策流水线。

在实验中,我们固定使用 Gemma‑4 作为后端模型,对 600 条开发任务分别应用了 13 种方法进行对比。结果显示,PaS+Audit 在关键指标上显著优于传统的 LLM+RAG 方案:精确匹配率 53.8%,宏观 F1 为 0.346,审查 F1 为 0.854,引用精度达 1.000,策略引用召回率 0.984,审计完整度 1.000。

确定性控制(Deterministic Control)进一步将整体准确率提升至 61.2%,但其效果高度依赖具体任务,表明该机制更适合作为选择性、基于规则的干预手段,而非全局统一的规则。

点评:PaS 展示了将治理需求嵌入 LLM 决策流的可行路径,尤其在证据可追溯和审计完整性方面提供了强有力的技术支撑。确定性控制的任务依赖性提醒我们在实际部署时需要细致的任务特征分析,以决定何时启用规则干预。

原文链接: https://arxiv.org/abs/2609.27087

[h] 返回首页