TW3Cast 在 GIFT‑Eval 基准上以平均 MASE 排名第 3(共 130 条目)进入榜单,提交时间为 2026‑09‑14。与排名前两位的多步代理系统不同,TW3Cast 完全不使用代理或语言模型,而是依赖一次性在训练集上计算并冻结的路由表,专家模型为公开的基础模型,仅在训练子集上进行轻微微调。\ \ 针对 97 种数据集‑频率‑预测视距的组合,路由表提供四种模式:\
- 专家模式:对 Chronos‑2、TiRex 或 Toto 进行 LoRA 或全参数微调,训练数据经显式规则清洗并增强;\
- 分位数混合:在专家模式基础上进行分位数融合;\
- 基础模型混合:直接混合未微调的基模型;\
- 选拔赛模式:在从训练集划分的回测上进行锦标赛选拔。\ \ 所有决策均基于该回测。只有当候选专家在锦标赛中胜出时才被录入,此时模型体积仅数 MB,GPU 训练时间仅数分钟;若未胜出则不影响已有路由。为抑制自身偏差,系统采用三重防护:双重准确度与校准标准、对已见序列的候选模型施加不对称裕度、以及保守的窗口门控。路由规则本身通过时间元回测进行挑选。\ \ 性能方面,单一最佳基模型的平均 MASE 排名为 33.8,针对每个配置的锦标赛模式为 38.0,而完整路由系统则达到 19.4。路由表、专家索引、固定的基模型版本、提交的得分文件以及公开分数的时间快照均已开源,论文中的每个排行榜数字均可通过一行脚本复现。\ \ 点评