摘要
探讨大型语言模型(LLMs)的能力以及构建多项选择题回答(MCQA)的稳健解决方案是自然语言理解中的核心挑战。此外,LLM 的快速普及使得人们隐含地认为更复杂的提示技术能带来更好的性能。虽然一些研究声称更复杂的提示技术表现更佳,但并未提供全面的评估。
我们通过对 10 个多项选择题回答(MCQA)数据集的 8 种提示技术进行全面的实证研究,涵盖 27 种模型配置和大约 4,300 个独特问题,进行了超过 430,000 次评估。我们的发现揭示了一个惊人的悖论:在各种基准测试中,基础提示技术始终优于复杂推理技术。只有最小的专家和归纳角色框架(CoT-Expert 和 CoT-Inductive)在基准上获得了约 3 个百分点(pp)的小幅但统计显著的提升,而我们测试的其他复杂技术则与基础技术相匹配或表现不佳,差距最大可达 31 pp(如 Self-Analogical)。
我们进一步调查了三个关键现象:(1)Qwen3-30B-A3B-Thinking-2507 在 Elo 评分中意外胜出;(2)不同思维预算下模型变体的性能效率权衡,揭示了模型依赖的最佳配置;(3)数据集难度的显著变化,60% 的基准准确率低于 70%,且从最简单到最困难的准确率差距达到 47.5 pp,表明模型改进的空间相当大。这些结果表明,LLM 评估社区可能在提示工程上过于复杂化,而在多样化基准中仍存在显著的性能差距,提供了真正改进模型的机会,而非仅仅是提示优化。
博主点评: 该研究通过实证分析揭示了复杂提示技术的有效性不足,强调了简单提示的优势,挑战了当前对 LLM 评估的普遍看法。研究结果鼓励开发者在模型改进上投入更多精力,而非仅仅追求提示的复杂性。