NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过音频感知大型语言模型的细粒度反馈提升文本到音频的指令跟随能力

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Machine Learning #Open Source

在文本到音频生成领域,尽管现有模型能够生成高质量的音频,但在处理涉及多个声音事件和时间顺序的指令时仍常常表现不佳。这一缺陷源于现有的评估和训练信号主要强调全局相似性或感知质量,而对指令级正确性的监督有限。为此,我们提出了一种指令级框架,利用音频感知大型语言模型(ALLMs)作为细粒度评估者,来验证生成音频中的目标事件存在性及其时间关系。

在对ALLM判断进行基准验证和人类验证后,我们使用它们的反馈构建偏好对,以进行直接的偏好优化。此外,我们引入了S3Bench,这是一个用于评估多事件时间指令跟随的叙述基准。实验结果表明,采用我们的方法能够改善事件完备性、时间排序和联合指令跟随的准确性,同时保持音频质量。

博主点评: 该研究通过引入细粒度反馈机制,显著提升了文本到音频模型在复杂指令下的表现,展现了音频感知语言模型在多模态任务中的潜力。未来的研究可以进一步探索如何将此技术应用于其他类型的生成模型中。

原文链接: https://arxiv.org/abs/2607.13408

[h] 返回首页