摘要
本研究探讨了在2011年NVIDIA Tesla C2075(Fermi,sm_20,6GB)上运行35B混合专家模型的能力,采用GPU预填充/CPU解码混合模式。本文关注能在设备内存中适配的模型MiniCPM-V-4.6,结合SigLIP2视觉编码器和窗口注意力合并(16倍视觉令牌压缩),完全基于GPU实现。
结果
-
全GPU引擎构建:基于测量的基础,采用8位权重解量化的投影方法,并在最后的Fermi工具链中调用供应商SGEMM,达成64%的FP32峰值;我们手写的GEMM达到了37%,被错误地称为上限。通过重写递归层的分块增量规则,使速度比顺序扫描快2.8倍,揭示了一个不良内核。
-
视觉部分的移植与验证:我们将塔、合并器和投影器转译为sm_20 CUDA,确保每个阶段与本地生成的参考前向验证(完整塔1.4e-5)相符。发现了一处失败,位置嵌入的桶化在精确有理数上有所不同,归纳出一条规则:在索引运算中,浮点数的平局处理是实现定义的;应调用参考运算符,而非重新实现。
-
长上下文的性能瓶颈:长上下文暴露了一个O(N^2)的瓶颈,短基准测试未能显示:在简单注意力内核中,预填充在2k令牌时为114 tok/s,而在10k时降至21;每头供应商GEMM调用在现有得分缓冲区中写入(无额外内存)恢复了平坦的性能曲线(2k时408,10k时361;17倍),由从60%深度精确检索针验证。同样的重写将图像编码时间缩短6倍,至0.93秒。系统可以在1.7秒内完成图像问答的端到端处理。
博主点评: 本文展示了在资源受限的环境下,如何通过巧妙的CUDA优化与模型设计实现高效的多模态推理。尽管硬件限制,研究者们仍然成功地提升了性能,展现了GPU计算的潜力与灵活性。