全双工语音语言模型在交互过程中会不断累积声学键值(KV)状态,导致长时对话的内存占用急剧上升。模型在监听时常常能够在下一个音频单元到来之前完成当前单元的处理,这段未被占用的时间我们称为监听时间余量。我们提出声学到文本的 KV 压缩方法,利用这一余量引入转录侧通道,将实时语音转换为紧凑的文本记忆。推理时若 KV 缓存超过设定预算,系统会驱逐最旧的声学状态,仅保留转录文本和最近的声学上下文。侧通道使用 LoRA 进行微调,损失函数为转录片段的交叉熵。为保持原模型的监听与发言行为,我们在原始模型的预测位置上对 token 级输出分布进行知识蒸馏。实验在十分钟的 LongSpeech 会话上进行,MiniCPM‑o 4.5 实现的峰值流式 KV 缓存大小比未使用驱逐的同模型降低了 64.6%。此外,压缩后模型在转录、时序问答和摘要任务上均优于基线。Full‑Duplex‑Bench 的评测显示,暂停处理、轮转和打断能力与基线相当。
点评