NeFut Logo NeFut
EN 管理员登录

[AI学术] 用户生成文本的音素化:基准、分类与组合方法

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

文本到语音系统越来越多地处理用户生成文本(UGT),如 ppl、imo 等,这类词的发音必须依据其规范形式而非表面形式推断。我们推出 UGTPhon,这是首个面向英语、越南语和韩语的字母到音素(G2P)基准,并提供基于推理的细粒度分类体系,用于错误诊断。实验表明,现有 G2P 模型和最前沿的大语言模型(LLM)在规范形式到非规范形式的转换上存在显著性能差距,最高可达 66.8 PER(音素错误率)点。作为基准基线,我们提出一种简易的组合式 G2P 方法:先通过精确匹配查表获取规范形式证据,再进行分阶段解码。该方法在 ByT5 与 Qwen2.5‑0.5B 两种骨干模型上均实现了显著的非规范 G2P 错误下降。尤其是 0.5B 版本的表现已可与更大规模的 few‑shot 前沿 LLM 相竞争,凸显显式建模规范形式推理对 UGT 音素化的重要性。

点评:本工作通过构建多语言基准和细致分类,揭示了现有模型在处理非规范文本时的局限,并用轻量级的组合策略实现了显著提升,为后续研究提供了明确方向。

原文链接: https://arxiv.org/abs/2609.27205

[h] 返回首页