随着多代理架构和大语言模型规模的扩大,部署的 AI 助手需要在长时段、多轮对话中进行推理。现有基准主要关注信息检索、时间推理或知识更新,却忽略了人机交互的关键维度——说话方式。为填补这一空白,我们推出了 VoiceLongMemEval(VLME)基准。每道题的答案都依赖于附加在对话轮次上的副语言元数据,包括情感标签、韵律描述和语音事件,这些信息仅凭文字无法恢复。所有样本均通过三阶段对抗门检验,确保仅凭转录文本的强语言模型会失效。实验对比了前沿闭源模型和开源权重模型,发现普遍存在情感感知缺口;加入文本轨道的副语言元数据可提升准确率 0.09~0.38(提供证据提示时提升至 0.61~0.69),而标准 ASR 流程会系统性丢失该信号。音频原生模型能够直接从语音中提取这些线索,准确率在 0.354~0.412 之间,高于盲测的 0.325。代码和数据集将在论文接受后公开。
点评