摘要
零-shot 摘要生成利用大型语言模型(LLMs)在抽象摘要任务中取得了显著进展,能够生成连贯且流畅的摘要。然而,大型语言模型的随机性引发了对其生成摘要的稳定性和可信性的担忧。这一问题在教育环境中变得尤为重要,因为学生和研究人员在零-shot 的方式下对复杂学术材料进行摘要。
我们提出了一种新颖的两级诊断协议,用于基于生成摘要的稳定性对 LLM 摘要生成器进行基准测试。在低级别上,对在受控环境下生成的多个 LLM 摘要进行文档级稳定性分析,并计算稳定系数。每个生成的摘要都根据与原始文档的语义和事实一致性进行评分,从而能够在多个维度上估计稳定性。
在下一级别上,从语料库中抽取的分层样本文档的观察结果被整合,以估算 LLM 摘要生成器的稳定性指数,作为其可信性的代理。我们对三种 LLM 摘要生成器在三种类型文档中的实证研究揭示了在摘要评估指标中,LLM 生成水平的变异性存在统计显著差异。这项研究通过对 LLM 摘要的稳定性问题进行证据性认可,推动了 LLM 摘要研究的发展,并激励了对开发稳健、可靠和可信的 LLM 摘要生成器的进一步研究。
博主点评: 本文突出了 LLM 摘要生成的稳定性问题,提出了创新的评估方法,为未来的研究奠定了基础。随着 LLM 技术的广泛应用,确保生成内容的可信性变得愈发重要,值得关注和深入探讨。