议会会议记录是民主讨论的主要记录,但其庞大体积和碎片化使得市民、记者和研究人员难以获取多角度的信息。将检索增强生成(RAG)应用于议会会议记录存在三个风险:最常发言者的主导地位、无法根据话题权威加权发言者以及在政治敏感文本中引用的错误归属。我们提出ParliamentRAG,一种针对意大利众议院的RAG系统,该系统解决了这些风险。其核心贡献是基于话题的权威模型,该模型根据当前查询估计每个发言者的权威,结合可解释的组件,如职业、教育和之前的干预。给定用户查询,该系统检索相关的演讲块,识别跨议会集团的话题相关专家,并生成一个总结,汇总他们的观点,并附上支持引语。ParliamentRAG通过两个层次的协议进行评估,该协议结合了自动化指标和六位领域专家的盲A/B人工评估,结果显示ParliamentRAG在15个政策主题上取得了更高的覆盖率(0.97 vs. 0.95)、完美的引语忠实度(1.00 vs. 0.95)和更强的专家偏好。在源相关维度上,NotebookLM在散文导向维度上仍然更强。 博主点评: ParliamentRAG系统通过引入基于话题的权威模型,有效解决了RAG在议会会议记录中的应用风险,为市民、记者和研究人员提供了更准确、更全面的信息获取途径。