大型语言模型往往拥有未在输出中显露的知识,模型可能在能力评估中故意保留答案,或因内部缺失而无法回答,仅凭外部输出难以判断是隐藏还是未知。我们借鉴法医学中的隐蔽信息测试(Concealed Information Test),该方法通过在多个合理干扰项中加入真实细节,观察受测者对真实项的更强反应来识别有罪知识。基于此思路,我们提出内部识别探测(Probe of Internal Recognition,PIR),在模型内部呈现一道多选题并读取其内部状态,判断模型对哪个选项产生了更强的识别信号。PIR 不依赖参考模型或标注真值语料,完全自洽。实验覆盖五个模型家族(Gemma、Qwen、Llama、Mistral、Phi)共八个模型,PIR 在平衡准确率上达到 0.70‑0.87,远高于未知项基线 0.28‑0.40 与随机 0.25。无论是提示诱导的欺骗、训练阶段的故意保留,还是外部密码锁、断路检查点等多种隐藏方式,PIR 的识别率均保持在 0.85‑0.93。当模型隐藏已知答案时,识别仍然强烈;而通过“忘记”删除知识后,识别降至模型从未学习过的水平。由此,PIR 能区分“不会回答”与“不会回答因为不知道”,为沙袋行为审计和知识消除验证提供工具。该信号具因果性,补充了黑箱行为线索,并可从多选题扩展到自由生成任务。
点评