NeFut Logo NeFut
EN 管理员登录

[AI学术] 何时让预测代理进行推理?可靠路由的行为压力测试

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#Machine Learning #LLM #Artificial Intelligence

预测代理越来越多地结合语言模型推理、检索、集成和校准,但何时信任每种行为仍不明确。我们在 ForecastBench 风格的二元预测任务上研究此问题,将检索、推理、依赖市场先验或使用历史类比的选择视为可观察的代理行为,而非隐藏实现细节。

核心发现是机制选择依赖于信息来源:对于某些数据生成过程,结构化类比表现最佳;而对于另一些,市场/群体式先验和保守基线更具优势。基于此,我们提出 ReliabilityRoute,一种利用可靠性特征(历史覆盖率、市场先验可用性、来源先验锐度、证据强度、证据分歧、预测时段)进行结构性干预的路由框架。

我们实现了两种规则。固定的 2024 年拟合规则在不使用硬编码来源名称的情况下,紧密匹配手工分类;而走前自适应规则则从已解决的历史批次中重新拟合阈值,在 16 个后续 LLM 批次中获得所有确定性系统中最低的平均 Brier 分数。尽管提升有限,历史和检索基线仍具强竞争力。

主要贡献是提供了一套行为压力测试,表明“更多推理”并非总是更好;预测代理应首先估计哪类证据来源值得控制,路由策略本身需在可审计约束下自适应调整。代码与可复现性材料已公开:https://github.com/louiswang524/forcastagent

点评

原文链接: https://arxiv.org/abs/2609.28475

[h] 返回首页