在对话AI中,如果模型无法区分自身输出与用户发言,它将把自己的错误视为用户提供的事实。这种能力在人的认知中被称为现实监控,其失败与幻觉、妄想和虚构相关,但大型语言模型(LLMs)是否具备这种能力尚未经过测试。
我们通过两个实验和六种LLM展示了源归属依赖于对话记忆的结构:在最低记忆需求下,自生成内容的准确性达到顶峰,而一旦情节延迟去除这种捷径,外部项目的优势则显得脆弱。
反馈揭示了两个失败:在某些模型中,内部和外部判断互换;在其他模型中,准确性提高而信心与正确性脱钩,这种分离在现有基准中不可见。跨模型的这一模式表明,活跃的参数计数,而非总计数,才是关键。
这表明,随着AI系统承担自主的多轮角色,仅评估它们所知的内容是不够的:追踪这些知识的来源可能同样重要。