NeFut Logo NeFut
EN 管理员登录

[AI学术] OmniVChat:全景音视频对话的合成、基准与训练

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #LLM

我们将 OmniVChat(全景视频聊天)定义为用户与全能模型之间的原生音视频对话任务。模型直接同步接收用户的音频和视频输入,并返回文本回复,用户的提问嵌入在音视频中,无需单独的文字问题、外部字幕或语音识别。直接的音视频输入能够降低外部延迟和计算开销,同时保留感知线索。

该领域面临两大瓶颈:真实录音数据稀缺,以及评价困难。高质量回复往往需要结合用户的环境、面部表情和周边物体,而这些信息的表达方式多样,导致基于关键词的匹配难以衡量回复质量。

受近期代理系统和视频生成技术进展的启发,我们构建了 OmniVChat-Studio——一个多代理数据引擎,用于合成单轮和多轮音视频对话。利用合成对话,我们搭建了 OmniVChat-Bench,覆盖五类基本对话能力的评测基准。

此外,我们提出 OmniVChat-RL,一种强化学习奖励设计,联合优化回复的正确性、效率和风格。基于合成对话对 Qwen3-Omni-Instruct 进行 OmniVChat-RL 训练后,在 OmniVChat-Bench 与真实录制的 OmniVChat-Bench-Human 上均取得显著提升,验证了奖励设计的有效性并展示了向真实对话的迁移能力。

点评

原文链接: https://arxiv.org/abs/2609.21465

[h] 返回首页