NeFut Logo NeFut
EN 管理员登录

[AI学术] Audio 大语言模型能够识别何时听不清

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#algorithm #AI #Machine Learning

Audio 大语言模型允许用户通过语音交互。当输入录音质量过差时,模型可能误解用户意图并基于错误的转录作答。本文研究模型条件下的转录可靠性:Audio LLM 能否识别自身转录不可靠的情况。

我们首先让模型评估自身转录的可靠性,发现模型判断能力很差,大多数情况下都会预测转录可靠。随后评估现有方法,包括语音质量预测器、Audio LLM 生成不确定性以及基于转录的 WER 估计,发现它们在检测转录失败时信号有限。相反,我们发现转录可靠性在模型的音频编码器表示中表现强烈。

基于此,我们设计了一个轻量级可靠性预测器,直接在冻结的音频编码器提取的表示上进行二分类预测,在生成前判断可靠性类别。该预测器可以在用户语音查询被预测为不可靠时触发澄清请求,而对可靠查询不做任何修改。实验中,预测器在域内达到 81.10% 的 macro‑F1,跨域达到 78.09%,分别比最强基线提升 10.33 和 11.93 分。

最后,我们展示了可靠性标签可以在不同 Audio LLM 家族之间迁移,迁移性能与模型特定可靠性边界的对齐程度密切相关。

点评

原文链接: https://arxiv.org/abs/2609.30625

[h] 返回首页