在多模态大语言模型(MLLMs)中,人类的记忆并非简单的记录,而是重构的过程。当前的MLLMs在这一点上存在不足,它们通过一个冻结的视觉编码器处理图像,生成一次性的文本输出,并丢弃内部表示。为了解决这个问题,我们提出了DoYouRemember,一个三阶段架构,将重构记忆引入MLLMs:
- 使用VQ-VAE将图像压缩为离散的视觉标记;
- 一个经过LoRA微调的LLM同时关注视觉和文本标记;
- 一个扩散解码器从LLM的隐藏状态重构图像。
在1,000个3D面部皮肤纹理图和99,000个未标记的面部图像上,我们发现LLM的隐藏状态几乎不包含可恢复的视觉信息——同样的解码器从VQ-VAE标记(LLM之前)生成清晰的重构,而从LLM隐藏状态(LLM之后)生成的却是纯噪声,这表明LLM可以理解图像,但无法记住它们。
在反向传播下训练共享记忆矩阵M时,由于梯度抵消(O(1/sqrt(N))衰减),系统性失败。我们识别出三个根本原因,并展示局部EMA更新能够解决这三个问题:每个图像只更新其64个槽中的前8个,保持槽间的多样性。最终得到的M(229K参数,压缩16倍)在未见测试图像上接近VQ上限。扩展到1,024个槽时超越了这一上限(LPIPS 0.056对比0.071),因为M的连续表示避免了VQ量化误差。我们在信息论框架下统一这些发现:记忆是有损压缩,回忆是解压,而幻觉是有损解压的固有特性,而非缺陷。
博主点评: 该研究为多模态AI系统引入了记忆重构的概念,挑战了当前模型对信息处理的传统理解。通过对图像和文本的联合关注,DoYouRemember架构为未来的智能系统设计提供了新思路,值得深入探索。