近期的自动语音识别(ASR)系统越来越多地引入大语言模型(LLM),通过外部的 logits 融合或内部的 warm 初始化来利用其语义知识。然而,如何高效地结合这两种策略仍缺乏系统研究。
本文聚焦于 warm‑initialized、LoRA‑适配的 LLM‑based ASR 模型,保持基准 LLM 的参数不变,利用其自身的预适应基模型进行二次优化。
我们提出 Hybrid Search,一种针对性校正方法,基于两条关键观察:
- LLM‑based ASR 隐藏状态与基准 LLM 隐藏状态之间的交互特征能够量化 token 的语义依赖程度;
- 只对语义依赖度高的 token 进行精细校正,可显著超越全局 LLM‑纠正手段(如 rescoring 与 late fusion)。
实验结果显示,即使在 warm 初始化已经完成语义知识迁移的情况下,利用基准 LLM 的隐藏状态仍能在推理阶段进一步提升识别准确率。
点评