最近的研究中,提出了一种新的提示优化方法,称为 RLMOpt。这种方法利用递归语言模型(RLM)来驱动搜索策略,使得语言模型不仅仅是生成或完善提示提案,还可以控制搜索的进展。RLMOpt 通过一个确定性的框架来保证目标评分、帕累托选择和回归约束。实验结果表明,RLMOpt 在四个基准测试中获得了最佳的结果,且比现有的方法更高效。 RLMOpt 的工作原理是通过 RLM 操作一个工具环境,检查任务信息、分析失败、生成候选、分配评估预算和决定何时停止。 $$ \text{RLMOpt} = \arg\max_{\text{prompt}} \text{score} $$ 其中,$\text{score}$ 是提示的评分,$\text{prompt}$ 是提示的内容。 博主点评: RLMOpt 是一个非常有前景的提示优化方法,它通过递归语言模型来驱动搜索策略,能够更好地利用语言模型的能力,获得更好的结果。同时,它也更高效,能够以更少的搜索次数获得更好的结果。