NeFut Logo NeFut
EN 管理员登录

[AI学术] 声音还是刻板印象?拆解语音到语音模型中的声学与内容性别偏差

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#algorithm #AI #Machine Learning

Speech-to-speech(S2S)模型已经被用于配音、翻译和语音助理等场景。与纯文本模型不同,S2S 模型会“听到”说话者的声音,而声音本身携带性别信息。理想的系统应当依据说话者的声学特征来判断其性别,而不是依据说话内容的性别刻板印象。

目前的大多数 S2S 系统在输出时使用单一、固定的声音,这使得评估模型是否会因内容偏向而改变输出声音变得困难。即使模型在声音上保持一致,内容偏见仍可能体现在对说话者性别的判断上。

本文提出两个核心问题:1)当模型复述输入时,内容中的性别刻板印象是否会影响输出声音的感知性别(声音渲染)?2)当模型直接给出说话者性别时,它是依据声音还是内容做出判断(性别归因)?

为回答这两个问题,研究者设计了一个受控实验:将男性和女性声音分别与男性化、性别中性和女性化的文本段落组合,覆盖五种开源和闭源模型,语言包括英语、西班牙语和普通话。实验结果显示,输出声音几乎不受文本性别刻板印象的影响,保持原有声学特征。但在性别归因任务上,所有模型都倾向于依据文本内容而非声音来判断性别。将文本从男性化→中性→女性化,模型判定为“女性”的概率会提升 1.7 到 24 倍。

当内容与声音冲突时,最差模型在 90% 的情况下错误标注性别;而内容与声音一致时,错误率仅为 2%。因此,性别偏见主要隐藏在性别归因环节,传统的固定声音评估方法难以发现,需要在 S2S 系统实际对外发声时进行更细致的审计。

点评

原文链接: https://arxiv.org/abs/2609.09263

[h] 返回首页