Sound Scene Generation(声场生成)旨在自动合成人工声场。我们发布了 SsgCaps,这是一套公开可用的人为构造声场数据集,每个声场都对应一个严格结构化的提示(prompt),该提示指导采样过程。提示来源于预定义的基于动作的类型学,既能实现大规模采样,又能保持情境的合理性。
SsgCaps 源自 2024 年 DCASE Challenge 第 7 任务的未公开参考数据集,该任务使用了私有和公共域音频。不同于原始数据,SsgCaps 仅包含公共域音频,从而可以向社区完全开放。
为了让数据集更具价值,我们首先阐述了提示和数据结构的设计动机。随后,对两个版本的数据集进行定量比较:使用 Fréchet Audio Distance(FAD)和 Kernel Audio Distance(KAD)以及感知评分,将它们分别与挑战赛中提交的 SSG 算法生成的音频进行对比。结果显示两版数据在上述指标上差异很小,因而我们推荐使用开放版作为后续 SSG 算法基准。
点评