NeFut Logo NeFut
EN 管理员登录

[AI学术] X-Translator:实时多语言说话人感知语音到语音翻译系统

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#AI #Machine Learning #Open Source

实时语音到语音翻译(S2ST)需要在翻译质量、延迟、语音自然度和说话人一致性之间取得平衡。已有公开的 S2ST 系统在直接、跨语言、流式和表达性建模上取得进展,商业产品和 API 也逐步提供实时翻译功能。但在长文本和多说话人对话场景中,部分 ASR 假设不稳定、发言边界模糊、目标语音需要对应说话人提示,导致可复现系统的部署仍然困难。

我们提出 X-Translator,一个低成本、模块化的级联 S2ST 系统。它通过会话级运行时控制器,将流式 ASR、机器翻译和基于提示的 TTS 组合起来。系统采用增量段提交(incremental segment commitment)把不稳定的 ASR 流转化为可翻译单元,并使用在线说话人提示管理器将源语音片段绑定到特定说话人的语音提示,以实现合成时的说话人保持。

在 OpenSTBench 上,我们评估了翻译质量、语音质量和延迟,并将结果与商业语音翻译 API 进行对比,作为行为基线。实验还测量了长文本的语音稳定性、在多说话人对话中的说话人保留效果以及多语言翻译质量。结果表明 X-Translator 在保持低延迟的同时,能够提供可接受的翻译和语音自然度,并有效保留说话人特征。

X-Translator 作为一个开放平台,帮助研究者理解部署导向的 S2ST 系统在实际应用中的权衡。代码和演示已在 https://github.com/zhaoyx239/X-Translator 开源。

点评

原文链接: https://arxiv.org/abs/2607.17544

[h] 返回首页