NeFut Logo NeFut
EN 管理员登录

[AI学术] GPS-Bench:治理政策基准用于自动化政策分析

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #LLM

GPS-Bench 是一个基于证据的治理政策仿真基准,旨在将政策、相关行为体、行为以及下游影响通过立法记录、游说披露、监管文件、公司报表、经济数据等公开资料进行关联。行为体不是通过提示生成的原型,而是从带时间戳的记录中重建,每个角色都是带有来源的证据对象。我们构建了人工标注的 Gold 评估集,同时使用另一个 LLM 从检索到的证据中生成的标签作为 Silver 监督,永不用于测试标签。

所有推理模式读取相同的证据状态并输出统一的 schema,这使得“多智能体仿真是否有帮助?”可以转化为受控比较。我们对比了联合推理、独立且可通信的行为体、基于图的方法以及对同一政策状态的权重级微调。实验表明,在有证据支撑的记录上进行微调能够得到最强的行为体层面影响预测,分解策略虽未超越微调,但提供了机制解释。

每个行为体持有私有且不完全相同的证据,只能看到自身的曝光条款,并针对命名的合作伙伴提出具体的联合提案、提供的资源、所需回报以及合作优于单独行动的原因。形成的联盟可以与记录中的承诺进行核对,从而验证模型的解释性。

GPS-Bench 为研究证据、行为体建模和多智能体交互何时提升政策结果预测与解释提供了统一的实证平台。

点评

原文链接: https://arxiv.org/abs/2609.03553

[h] 返回首页