TimeThink 是一个用于激发时间序列大语言模型(TS‑MLLM)组合推理的合成框架。现有 TS‑MLLM 在问答任务中虽借助 LLM 的推理能力,但往往只能捕获隐式推理,难以解释动态时间模式,尤其在医疗等高风险场景不足。基于强化学习的时间序列语言模型尝试显式推理,却因训练数据局限于分布内且难以处理分布外的组合问题而受限。TimeThink 通过定义领域无关的核心时间序列原语(如趋势、季节性),实现可确定性生成。其合成数据生成器能够构造原子和复合的问答对,并提供带有推理轨迹的客观真值。随后,TimeThink 采用可验证奖励的强化学习(RLVR)策略,鼓励模型输出显式推理过程。不同于依赖模板的做法,RLVR 使模型学习组合背后的逻辑而非单纯模仿轨迹。大量实验表明,仅在合成数据上训练的 TimeThink 在合成和真实基准上均显著超越强基线。
点评:该工作展示了合成数据与可验证奖励相结合的潜力,为时间序列大模型的可解释推理提供了新路径。