NeFut Logo NeFut
EN 管理员登录

[AI学术] Ruby-ASR:保持证据的正字与词汇阅读联合识别

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#algorithm #AI #Machine Learning

Ruby-ASR 通过在目标序列中加入正字‑词汇阅读对应的 span,克服了传统日语 ASR 只使用正字转录的局限。传统系统把同形不同读的词映射到相同的文字标签,导致阅读信息在监督中丢失,后处理的文字到音素转换也难以恢复。Ruby‑ASR 使用 ruby 表示法,在每个书写 span 后紧跟其实际读音,实现正字与阅读的局部绑定,既可以确定性地恢复完整的正字文本,又能得到对应的词汇阅读。我们在 Qwen3‑ASR 骨干上实现两种转录风格:字幕式和逐字式,并在 mora 级别加入 CTC 损失作为辅助的单调阅读监督。实验在五个日语基准上进行,结果表明,在不牺牲可读正字转录的前提下,词汇阅读的恢复率显著提升。模型检查点和推理代码已公开。

点评

原文链接: https://arxiv.org/abs/2609.27289

[h] 返回首页