摘要
开放式调查提供了宝贵的见解,但在大规模分析中却极其困难。本研究基于以往使用传统机器学习对文本进行分类的工作,探讨了不同的大型语言模型(LLMs)如何理解和分析NSSE开放式调查的回应。我们聚焦于几种前沿LLMs——OpenAI的GPT系列、Twitter的roBERTa-base模型以及Meta的LLaMA,并将它们在情感分析和主题分类等任务中的表现与之前的机器学习模型进行了比较。
研究分析评估了模型一致性、分类准确性和推理的可解释性。结果显示,当前的LLMs在分类准确性上常常优于经典机器学习模型,尤其是在理解学生回复中的复杂情绪和主题模式方面。尽管LLMs具有更高的准确性,但它们在解释预测和应用类别边界时的明确性和一致性差异显著。这些区别突显了使用LLMs进行定性分析时的重要权衡:增强的预测能力伴随着一致性和可解释性的问题。
我们的发现展示了利用各种LLMs进行大规模定性研究的优缺点,并为希望平衡自动化与解释性严谨性的研究者提供了实用建议。
博主点评: 本文深入探讨了大型语言模型在处理开放式调查数据时的优势与不足,尤其是在准确性和可解释性之间的权衡。随着LLMs的广泛应用,理解其局限性将有助于研究者更有效地利用这些工具进行数据分析。值得注意的是,如何在自动化与人工解释之间找到最佳平衡仍是未来研究的重要方向。