NeFut Logo NeFut
EN 管理员登录

[AI学术] 每个 Token 的计算成本是多少?基于混合代理的足够计算度量

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

大型语言模型在生成每个 token 时会消耗相同的计算量,然而不同 token 的实际难度并不相同。为了解真实的计算需求,本文提出了 混合代理(Mixture‑of‑Agents,MoA) 方法:选取来自三大模型家族的十五个容量递增的语言模型,组成一个面板。每个模型在已知前置正确 token 的条件下,尝试逐个复现参考序列的 token。我们将能够成功复现该 token 的最小模型的推理成本定义为该 token 的 足够计算(sufficient compute),它上界了该 token 实际需要的 FLOPs。

在三个核心基准上,容量为 0.5B 的模型能够复现 92%‑95% 的参考 token。对 Qwen、OLMo、R1‑distilled 三个面板进行统计,最昂贵的 10% token 占总 FLOPs 的 64%‑80%。在 500 道 MATH‑500 题目上,利用 MoA 生成的计算映射进行模型路由,可将预测延迟从 7.59 秒降至 5.12 秒,并略微提升准确率,相比最佳的置信度路由基线有明显优势。对于草稿生成任务,使用 MoA 映射的动态窗口比固定窗口少使用 32.6% 的草稿 token,且在相似准确率下约降低 20% 的预测延迟。

这些实验表明,当前模型仍有大量计算冗余空间,鼓励设计能够利用足够计算结构的调度控制器,以实现更高效的推理。

点评

原文链接: https://arxiv.org/abs/2610.02491

[h] 返回首页