NeFut Logo NeFut
EN 管理员登录

[AI学术] 何时文本提供信息?多模态时间序列预测的信息论度量基准

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#algorithm #AI #Machine Learning

多模态预测模型通过将时间序列与文本注释结合,能够利用文本上下文提升预测质量。然而,如何判断一段文本注释是否真正为预测提供了有价值的信息?这本质上是一个信息论问题。要评估信息论度量能否可靠地衡量注释的预测价值,需要一个已知真值的基准,而目前尚不存在此类基准。

我们构造了一个合成时间序列信号,并人为添加三类文本注释:语义正确、语义错误和无关。由于数据生成过程完全受控,注释的真实信息量可以精确计算,从而对六种互信息估计器进行原则性评估。这六种估计器分别是 KSG、MINE、InfoNCE、CCA、PID 和 V‑information。

实验表明,所有估计器都能够将语义正确的注释识别为信息量最高,并且能够在无需训练预测模型的情况下,对混合文本语料库进行质量审计,挑选出能够带来最佳下游预测效果的注释。基准测试同时揭示了每种估计器的局限性,这些局限性在七个真实数据集上得到验证,展示了在弱信号场景下估计器表现的差异。

最后,我们归纳出一套实用规则,指导在注释审计和融合选择过程中如何高效实现这些信息论度量。

点评

原文链接: https://arxiv.org/abs/2609.11282

[h] 返回首页