摘要
代理技能封装了可重用的程序,提升下游性能。这种轻量、可移植的形式使得市场化变得可行,并且可以在云托管的代理接口后进行私有部署,给提供者提供了保持高价值技能专有的激励。然而,隐藏这些工件并不能掩盖它们的行为效应,这些效应在执行轨迹中依然可观察,并形成了一种行为侧信道。我们将这种暴露定义为“技能泄露”:从无参考答案或成功标签的良性查询引发的轨迹中重建专有技能。
我们引入了 SigLeak,这是一个黑箱框架,利用代理行为中的重复技能特征。它构建多样、决策丰富的诊断任务,比较匹配的技能启用和禁用的轨迹,并迭代地从孤立模式中细化重建的技能。在五种场景、三种模型家族和三种代理框架下,SigLeak 在几乎每个设置中都超越或匹配了三个基线。它平均提高了 6.88 个百分点的成功率,相对于技能禁用参考,并在我们粗细粒度语义相似性指标 SkillSim 中达到了最高的整体表现。这些结果表明,良性的执行轨迹可以暴露专有的程序知识。
代码可在 SigLeak-D1DB 获取。
博主点评: 这项研究揭示了代理技能的泄露潜在风险,尤其是在云环境中。SigLeak 的框架展示了如何通过分析执行轨迹来重建技能,这对于理解和保护专有技术至关重要。研究结果为未来的安全性和隐私保护提供了新的思路。