NeFut Logo NeFut
EN 管理员登录

[AI学术] 抵御恶意节点的对等分布式大语言模型推理完整性保障

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Machine Learning

摘要

对等分布式推理通过将大语言模型(LLM)的层分布在多个节点上,在消费者硬件上执行模型。在这种设置中,每个请求都经过由多个独立方拥有和控制的节点。然而,任何一方都可以篡改其层的输出,从而破坏最终结果。虽然在可信硬件上重新计算前向传播可以捕捉到这种篡改,但会引入额外的计算成本。科学文献中已有多种完整性检查方法,例如用于图像分类器的已知答案陷阱和密码学承诺。然而,这些解决方案仅测试确切的正确性,并未考虑良性节点之间可能出现的普通变异。

在本文中,我们提出了一种通过测量每个节点传递给下一个节点的激活值变化来检查输出完整性的方法。希望使用该网络的对等节点选择一小组已知正确激活的秘密金丝雀输入,并将其混入常规流量中。由于对等节点无法区分金丝雀输入与真实查询,任何篡改节点也会对其进行破坏。因此,从已知参考的偏差可以揭示恶意活动:良性节点仅表现出微小的硬件诱导噪声变异,而被篡改的节点则偏差更大。我们将恶意节点的识别视为一种概率测试,区分两个漂移分布,而不依赖于固定阈值。我们研究了408种配置,在任何实验运行之前固定了指标和成功标准;检测器达到AUROC 1.0,在每种配置中正确地将恶意分片的排名置于每个良性分片之上。

博主点评: 该研究提出了一种创新的方法来确保对等分布式系统中大语言模型推理的完整性,利用金丝雀输入检测恶意节点的策略,既提高了安全性,又降低了计算成本。其方法的有效性通过高达AUROC 1.0的检测率得到了验证,展示了在分布式环境中实现安全推理的潜力。

原文链接: https://arxiv.org/abs/2607.19490

[h] 返回首页