在本研究中,我们将语义记忆检索视为在概念空间中的导航。通过对82名参与者和三种大型语言模型(GPT-4o、Gemini-2.5-Pro、Claude-Sonnet-4.5)的语义搜索动态进行比较,使用了基于轨迹的自然语言处理(NLP)指标,分析了在八种温度设置下生成的项目。
我们量化了三个互补维度:熵(步长可预测性)、下一个距离(连续语义步骤)和质心距离(全局分散度)。结果显示,人类的熵更高、语义步骤更大且分散更广,表明其搜索过程更具变异性和探索性。
温度调节仅产生部分对齐,个别指标在特定设置下与人类匹配,但没有任何配置能重现人类的完整特征(在所有维度上)。这些发现表明,人类的语义搜索在局部利用与全局探索之间实现了独特的平衡,而当前的模型架构未能再现这一点。
博主点评: 本研究深入探讨了人类与大型语言模型在语义导航上的差异,揭示了人类在探索性和变异性方面的优势。这为未来的模型改进提供了重要的启示,尤其是在如何更好地模拟人类思维的语义搜索方面。希望后续研究能够进一步缩小这一差距。