Mixture‑of‑experts(MoE)模型通过稀疏的每标记计算,使近万亿参数容量可用,前提是服务系统能够分发权重并协调执行。我们在十一台配备 Intel Core Ultra X7 358H、64 GB 内存、Arc B390 集成显卡和千兆以太网的 AI PC 上常驻运行 Inkling 模型,模型总参数 975 B、激活参数 41 B。\ \ 我们实现了自研 resident MoE 引擎,完整保留 Inkling 的路由规则,生成压缩图供 OpenVINO 的融合 iGPU 原语使用,并在 FP16 专家计算后恢复为 FP32 输出。引擎在每台机器上容纳六层连续解码器,将密集前馈块表示为全激活专家切片,使密集层调用时间从约 8.1 ms 降至 4.5 ms。\ \ 一个流式管线负责并发生成,捕获状态的草稿评估用于衡量与部署数值路径的一致性。我们在 1 到 176 条流的十五个并发级别上进行配对测量,88 条流时聚合解码吞吐达到 60.29 token/s,完整服务阶段为 46.87 token/s。十五条流时中位首 token 延迟为 6.05 s。\ \ 将上下文预算从默认的 1 024 位置提升至 64 k,真实提示长度在 1 k‑64 k 之间时,所有 19 条测得答案中的嵌入代码均被成功恢复。首 token 时间随 $aN+bN^2$ 增长,解码延迟近线性增长,两者均受单线程 CPU 注意力循环限制,而非内存瓶颈,内存可容纳每条流 512 k 位置。\ \ 在捕获的舰队状态上进行评估,分离了词表选择和权重量化对草稿一致性的影响。\ \ 这些工作共同确立了一套在共享 CPU‑GPU 内存的分布式客户端系统上执行大规模稀疏模型的执行与评估方法。\ \ 点评