NeFut Logo NeFut
EN 管理员登录

[AI学术] TLive-Omni:面向电商直播的全模态理解模型

发布于:2026-08-24 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #Neural

电商直播的内容往往噪声较大且时长较长,商品信息分散在主播语音、视频画面、商品图片、叠加文字以及用户提问中。为此我们提出 TLive-Omni,一种专为直播电商设计的全模态理解模型。模型将图像、视频、音频和文本统一映射到同一表示空间,实现跨模态信息的融合。针对长时段直播分析,我们引入 Per‑vGrid——一种带时间戳的 token 组织方式,将每个视频网格与对应时间段的音频放入显式边界 token 中,以便实现精确的时序对齐。训练方面采用三阶段监督学习:先学习全模态感知,再进行指令跟随的响应生成,最后通过 Faithful‑RFT 强化微调提升答案的忠实度和表达质量,并满足实时响应需求。Faithful‑RFT 直接使用任务可验证的反馈对最终答案打分,而不是在 rollout 期间优化推理式探索。模型还配备了面向场景的原子能力体系和紧凑的数据生成引擎,能够把直播音视频流转化为语音识别、说话人分析、商品视觉定位、文字识别、时序定位、视频密集描述和全模态问答等训练信号。为提升训练效率,采用同步长度分组采样器在降低填充的同时保持各工作节点的负载相当;轻量级动态采样策略在 rollout 时几乎零奖励方差地重新生成分组,以保持 GRPO 的相对优势。实验在电商直播基准上展示了模型在多任务上的强劲表现,并在通用基准上保持良好泛化能力。

博主点评:TLive-Omni 通过创新的时间对齐机制和分阶段训练,显著提升了直播电商场景下的全模态理解能力,为实际部署提供了可行路径。

原文链接: https://arxiv.org/abs/2608.20958

[h] 返回首页