NeFut Logo NeFut
EN 管理员登录

[AI学术] 语义覆盖:通过注解超越令牌与引导向量缓解提示注入

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

语言模型的所有输入都是令牌。服务层能够区分每段文本的来源——用户输入、工具输出、指令等——但模型本身必须自行追踪这些跨度的身份,容易出现混淆。攻击者利用这一点,通过提示注入扰乱模型对跨度身份的理解,从而诱导模型执行不期望甚至危险的操作。为了解决此类攻击,本文提出在模型输入中加入非文本通道,即 语义覆盖(Semantic Overlays):在冻结模型的残差流的特定预填充位置插入小型学习适配器,形成一种带外注解通道,令牌无法复制。与传统的引导向量不同,语义覆盖是可训练、可适配且可选择性应用的。覆盖可以编码复杂语义,改变模型对标记跨度的感知。例如,在覆盖声明代码片段属于另一种编程语言时,模型会忠实地将该片段转换为声明的语言。覆盖具备可组合性,能够透明读取底层内容,并可携带指令性负载——如标记为“不可执行”,即可防御在不可信上下文中添加指令的提示注入。实验在多个提示注入基准上取得显著提升:SEP 分离率从 24.3% 提升至 96.5%(实用性保持不变),TensorTrust 攻击成功率从 34.8% 降至 6.6%,四类 PIArena 攻击的合规率全部降至 0%,同时标记跨度的可读性保持在 92.5% 的精确复制率。

博主点评:语义覆盖提供了一条全新的、基于模型内部流的防御路径,既保留了模型的原始能力,又通过非文本注解实现了对提示注入的强力抑制,值得在实际系统中进一步探索与部署。

原文链接: https://arxiv.org/abs/2608.23873

[h] 返回首页