我们使用基于 roofline 形状的预测模型,从 GGUF 元数据中预测单序列 llama.cpp 的吞吐量。模型在量化特定的比例因子上进行拟合,这些因子来源于参考模型。实验数据包括 318 条相位深度测量,覆盖 53 种主机‑文件配置,分别在两台 Apple M4 Max 和一块 NVIDIA RTX 5080 上采集。
在每台主机的留出集(分别为 4、5、2 种配置)上,使用活跃参数解码模型的平均绝对百分比误差(MAPE)分别为 13.1% 、14.4% 和 36.1%,而仅使用总参数计数时误差升至 49.4% 、55.3% 和 51.9%。
采用留一主机交叉验证的系数,在其余两台系统上测试得到的 MAPE 为 11.6% 、16.8% 和 36.0%。低位模型阶梯在不同运行时堆栈中会改变排序。P2 预填基线的测试 MAPE 为 18.7% 、22.2% 和 108.2%。
GGUF 的结构信息在三台系统上均有帮助,但拟合得到的效率系数并非通用。
$$\text{MAPE}=\frac{1}{n}\sum_{i=1}^{n}\left|\frac{y_i-\hat{y}_i}{y_i}\right|\times100\%$$
点评