NeFut Logo NeFut
EN 管理员登录

[AI学术] 对话记忆下的现实监控:大型语言模型的自我知识转变

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #LLM

在对话AI中,如果模型无法区分自身输出与用户发言,它将把自己的错误视为用户提供的事实。这种能力在人的认知中被称为现实监控,其失败与幻觉、妄想和虚构相关,但大型语言模型(LLMs)是否具备这种能力尚未经过测试。

我们通过两个实验和六种LLM展示了源归属依赖于对话记忆的结构:在最低记忆需求下,自生成内容的准确性达到顶峰,而一旦情节延迟去除这种捷径,外部项目的优势则显得脆弱。

反馈揭示了两个失败:在某些模型中,内部和外部判断互换;在其他模型中,准确性提高而信心与正确性脱钩,这种分离在现有基准中不可见。跨模型的这一模式表明,活跃的参数计数,而非总计数,才是关键。

这表明,随着AI系统承担自主的多轮角色,仅评估它们所知的内容是不够的:追踪这些知识的来源可能同样重要。

原文链接: https://arxiv.org/abs/2607.23927

[h] 返回首页