摘要
文档基础的LLM系统在保护机制检查之前,通常会将PDF文档进行扁平化处理。这一步骤可能会丢失一些证据,表明某些指令从未对用户可见。我们提出了CrackedPDFs,这是一个用于PDF中隐藏提示注入的受控基准测试。该基准包含来自4,983个基础文档生成的29,322个PDF文件,其中包括9,774个注入文件和19,548个无害或匹配混淆文件。
我们对PromptGuard和一个规则基线进行了评估。同时,我们还评估了仅使用结构的学习模型和一种经过净化的混合检测器。评估使用了保留的来源拆分和配对的无害混淆控制,此外还包括标签随机检查和快捷审计。
在2,919个文档的保留测试集上,混合检测器达到了0.960的F1分数,ROC-AUC为0.998,PR-AUC为0.997。它在973对中有95.9%的情况下将注入文件排名高于匹配的无害混淆文件。而PromptGuard在仅给出提取文本时的召回率较低。仅使用结构学习的模型在配对控制下表现较弱。一个仅基于TF-IDF的文本模型达到了完美的保留分数,但在快捷审计中失败。这些结果表明,在受控配对评估下,文档感知的混合检测是有用的,但并未展示出广泛的真实世界鲁棒性或可靠的跨家族泛化能力。
博主点评: CrackedPDFs为PDF中的提示注入提供了一个重要的基准测试,揭示了当前LLM系统在防护机制下的潜在缺陷。尽管混合检测器在受控环境中取得了优异的表现,但其在实际应用中的可靠性仍需进一步验证。