摘要
大型语言模型(LLMs)在数学问题求解中的评估日益增多,然而,先前的研究往往将表示等价的形式视为可互换,并混淆了推理错误与接口失败。本文通过系统变化相同基础问题的表面表示,探讨了LLM基础数学问题求解中的表示鲁棒性,包括故事问题、文字方程、符号方程和同构释义。
我们使用一个经过精心挑选的数学等价问题数据集,在直接生成答案的条件下评估五个当代LLM。结果显示显著的表示敏感性:模型在不同等价形式中正确率经常变化,且在故事、符号和文字方程变体中存在非平凡的翻转率。我们还观察到在同构改写下的系统性退化,表明即使是细微的释义变化也会降低性能,尽管数学结构得以保留。
接着,我们评估了一种代码增强条件,在该条件下,模型将推理外化为可执行的Python代码并在本地运行进行验证。这种接口揭示了一些模型在直接提示下表现不佳但具有强大潜在推理能力的特性,然而并不均匀地提高了鲁棒性。相反,失败在交互层之间转移,从不透明的推理错误到协议违规和执行失败。即便在可执行推理成功的情况下,表示敏感性仍然存在。
总体而言,我们的结果表明推理支架并未消除表示脆弱性,而是暴露出正确性、可靠性、延迟和成本之间的新权衡。我们认为,表示应作为LLM评估和部署中的一类重要接口设计变量,尤其是在AI辅助问题解决系统中。
博主点评: 本文深入探讨了大型语言模型在数学推理中的表现,揭示了表示形式对模型性能的重大影响,强调了在设计AI系统时应当关注表示鲁棒性的问题。这为未来的研究提供了重要的方向,值得关注。