摘要
转码器作为一种新兴的机制可解释性(MI)方法,正在为模型行为的电路级分析提供可能性。本文探讨了使用转码器分析语言模型中的欺骗行为,这种行为构成了安全和安保风险。
我们使用了预训练的 Qwen3-4B 模型和分层转码器(PLTs),构建了捕捉特征激活和特征间依赖关系的归因图,从而实现对欺骗行为的电路级分析。通过特征引导和电路分析,我们识别了一组与欺骗相关的特征字典,并发现这些特征对欺骗输出的影响更强,因为它们在欺骗性和非欺骗性响应之间产生可预测的变化。
这些发现表明,欺骗行为源于内部模型机制,并强调了转码器在行为监控和早期检测语言模型中恶意行为相关安全漏洞的潜力。
博主点评: 本文通过转码器为语言模型的欺骗行为提供了新的分析视角,展示了如何通过电路级分析来识别潜在的安全风险,为未来的模型安全性研究开辟了新的方向。转码器的应用可能会成为监控和防范语言模型恶意行为的重要工具。