尽管大语言模型(LLM)的能力不断提升,提示设计仍主要依赖经验和临时方法。本研究聚焦于 $\textit{prompt\ minimization}$,即在保持输出保真度的前提下,将提示压缩至信息最密集的最小形式。更短的提示可以降低计算开销和推理延迟,尤其在需要包含整篇文档或代码库等大上下文时尤为重要;同时,冗长提示还可能削弱模型的推理能力和准确性。理论上,多个不同提示能够产生相同输出,说明输入空间存在大量冗余,这引发了关于哪些信息是触发特定模型行为的关键的根本性问题。我们提出三种框架来识别和评估最小提示,并实验表明,最小提示往往能产生与长提示相当的输出质量。这些结果为高效提示工程指明了新方向,也加深了对 LLM 输入压缩机制的理解。
点评:提示最小化展示了在保持模型性能的同时显著提升效率的潜力,为实际部署和理论研究提供了有价值的视角。