我们指出,仅用准确率评估具备推理能力的大语言模型会遗漏关键的部署问题:何时扩展思考代币的成本是值得的。为此提出 代币经济得分(Token Economy Score,TES),它衡量推理模型相较于非推理基线的准确率提升,并以生成代币的倍率进行归一化。
$$\text{TES}=\frac{\text{Acc}_{\text{reason}}-\text{Acc}_{\text{base}}}{\frac{\text{Tokens}_{\text{reason}}}{\text{Tokens}_{\text{base}}}}$$
针对拥有推理开关的模型族,我们定义 配对 TES(paired TES),直接比较同一模型在开启/关闭推理时的表现。对于没有直接非推理对应的前沿模型,采用 近似 TES(approximated TES),利用相近模型的基线数据进行估计。
我们在七个基准上完成了 151 次模型‑基准评估,覆盖数学、代码生成、科学推理、指令遵循、专家知识、知识回忆以及研究级物理等任务。分析聚焦三个面向部署的维度:
- 哪类任务结构能够产生正向的边际推理效率;
- 在同一模型族中,提升推理力度(如增加思考步数)如何影响 TES;
- 部署环境(云端 vs 本地)如何改变经济可行性。
结果显示,任务结构比名义难度更能预测推理效率。顺序推理链任务(如 AIME 2025、LiveCodeBench)拥有高 TES,而看似困难的知识回忆任务(如 MMLU‑Pro)TES 较低。随着推理力度提升,收益出现系统性递减,甚至出现额外思考导致准确率下降的情况。
我们进一步引入 推理成本占比(Reasoning Cost Share,RCS)和 部署成本倍率(Deployment Cost Multiplier,DCM)。RCS 表明在推理开销中,内部思考往往占主导;DCM 则说明在本地部署时,原本昂贵的推理工作负载可能因硬件成本结构而变得更具经济性。
博主点评:本文提供了一个实用的经济视角来评估 LLM 推理的价值,提醒我们在实际系统中应按任务类型、推理深度和部署方式有选择地开启推理,而非盲目追求更高的思考步数。