敏感信息的定义取决于具体领域和使用意图,而不是一个通用类别。传统的脱敏系统(如隐私过滤器和命名实体识别器)在训练阶段就固定了分类体系,导致每当出现新领域时必须重新训练模型。为了解决这一瓶颈,我们提出了 ASIRF(Agentic Sensitive Information Redaction Framework),它在推理时能够根据输入文本的领域从灵活的知识库中检索领域特定的定义,无需额外的模型微调。
ASIRF 包含两种实现架构:
- 三次调用的多代理流水线:通过三个独立的代理分别完成(1)领域识别,(2)定义检索,(3)信息脱敏。
- 单代理变体:在同一代理内部顺序执行上述三步,降低调用开销。
我们在十个小型开源模型和八个数据集上进行评估,其中包括跨域的虚构场景。基准采用 OpenAI Privacy Filter(OPF)作为训练好的分类器。实验结果显示,在 80 组模型‑领域组合中,ASIRF 在 68 组(85%)上实现了比 OPF 更高的召回率,且两种架构中至少有一种表现优于 OPF。性能下降主要出现在 OPF 已经见过的训练分布领域,说明 ASIRF 在未见领域的适应性更强。
值得注意的是,ASIRF 只需要每个领域几十条由专家撰写的定义,无需任何标注的训练数据,即可实现高效脱敏。该框架展示了通过知识库驱动的代理系统在敏感信息处理中的潜力,为跨领域隐私保护提供了一条可行路径。
点评:ASIRF 通过将领域知识外部化,实现了无需再训练即可快速适配新场景的脱敏能力,显著提升了跨域隐私过滤的实用性和灵活性。