语言模型的能力随参数量和训练数据的增加而提升,这一规律在 Mixture‑of‑Experts(MoE)架构中得到充分利用——每个 token 只激活庞大参数库中的一小部分。然而,这种成功依赖于静态的预训练数据。实际部署时,模型面对的环境不断变化,用户提供的事实或纠正往往不在训练集内,传统模型的权重在训练后被冻结,无法从这些实时交互中学习。于是,知识和行为只能通过检索或指令写入提示,在每次请求结束后即被丢弃。我们设想一种能够把实时交互写入权重的架构。受 MoE 启发,提出 Infinite‑Parameter LLM。一个紧凑的超网络把运行时数据转化为共享基网络的低秩调制,使前馈权重由实时数据生成,而非存储在固定的参数库中。不同于一次性读取并冻结的传统权重生成器,我们对生成器的潜在代码保持贝叶斯信念,并在会话进行中在线更新,权重随信念的演化而重新推导。模型的存储占用保持不变,但可编译的权重实际上是无限的。将运行时的知识和行为写入权重而非提示,可在计算上实现摊销,释放上下文窗口,跨轮次保持并有望比仅靠提示更好地泛化。我们还制定了评估协议,直接比较该方法与提示学习及检索的效果。
点评