摘要
政治联盟的形成是一个复杂的谈判过程,受到具体政策目标和深层意识形态信念的驱动。尽管大型语言模型(LLMs)为计算政治科学开辟了新途径,但通过人类反馈强化学习(RLHF)植入的中立性和有用性偏见,阻碍了它们维持坚定的党派行为。
我们提出了一个多代理框架,通过结合监督微调(SFT)、直接偏好优化(DPO)和增强检索生成(RAG)来调和事实基础与意识形态一致性:DPO 赋予了激进的党派特征,而每个党派的 RAG 管道确保各代理遵循其官方纲领。我们在 2019 年弗拉芒选举中实现该框架,将党派代理部署在由 formateur 仲裁的中心-辐射谈判中。
为了使新兴的谈判过程可解释,我们引入了多层信息传承拓扑(MILT),追踪最终协议中的每一条条款回溯其纲领来源,并将其分类为五种来源状态;同时引入了联合影响评分(CIS),聚合这些可追溯的贡献以识别哪个党派塑造了协议,并进行现实基础传递,以基准每个模拟条款与历史上通过的联盟协议。
在三次独立模拟中,该框架产生了一个稳定的赢家和排名(N-VA 排在 CD&V 和 Open Vld 之前),而与纲领锚定的传承可靠地预测了现实世界的实现,而虚构内容则不然。结果是一个透明、可扩展的测试平台,用于探索党派兼容性和 formateur 介导的妥协。
博主点评: 本文提出的多代理框架通过结合多种优化方法,为政治联盟的形成提供了新的视角,特别是在理解党派行为及其影响方面。然而,如何进一步降低模型的偏见和提升其适用性仍是未来的研究方向。