NeFut Logo NeFut
EN 管理员登录

[AI学术] 生成溯源在行为归因前的必要性:合成语音审计研究

发布于:2026-10-03 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning

在对合成训练数据进行行为归因时,需要先知道每个训练样本的生成来源,再评估该样本的影响。单纯的波形‑标签对无法保存此信息。我们提出一种生成溯源基底,能够将源规范、生成内容、波形、目标、事实需求、质量信号、审查血统以及不可变的清单标识绑定在一起。生产者和选择机制决定证据含义,存储位置和变量名不影响。

我们在一个私有的日语交接流水线中审计了该基底。审计对象包括113个资产,总计1.552小时的合成语音,覆盖六类场景;每项都关联音频、转录、候选备注和事实检查清单,但人工证据仅在特定来源下可得。两个仅保真度的清单在场景种子上互不重叠且不可变版本化,而上游精确归因受限于漂移的生成器别名、缺失的逐片段TTS和代码标记以及未版本化的检查提示。

我们认为生成溯源是行为归因的必要前提,但不足以完成因果归因:它定义候选因果图和审计单元,真正的贡献归因仍需冻结的训练运行以及干预或影响证据。本文贡献了紧凑的溯源合约、审计协议以及合成数据归因的受限案例研究;可提供受控研究访问,但不声称因果训练数据归因、临床有效性或无限制公开。

点评

原文链接: https://arxiv.org/abs/2610.01378

[h] 返回首页