NeFut Logo NeFut
EN 管理员登录

[AI学术] 倾听潜在信息:通过隐藏状态交互实现大规模音频语言模型的自纠错语音识别

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#AI #Machine Learning #LLM

近期的自动语音识别(ASR)系统越来越多地引入大语言模型(LLM),通过外部的 logits 融合或内部的 warm 初始化来利用其语义知识。然而,如何高效地结合这两种策略仍缺乏系统研究。

本文聚焦于 warm‑initialized、LoRA‑适配的 LLM‑based ASR 模型,保持基准 LLM 的参数不变,利用其自身的预适应基模型进行二次优化。

我们提出 Hybrid Search,一种针对性校正方法,基于两条关键观察:

  1. LLM‑based ASR 隐藏状态与基准 LLM 隐藏状态之间的交互特征能够量化 token 的语义依赖程度;
  2. 只对语义依赖度高的 token 进行精细校正,可显著超越全局 LLM‑纠正手段(如 rescoring 与 late fusion)。

实验结果显示,即使在 warm 初始化已经完成语义知识迁移的情况下,利用基准 LLM 的隐藏状态仍能在推理阶段进一步提升识别准确率。

点评

原文链接: https://arxiv.org/abs/2609.02940

[h] 返回首页