摘要
许多模型输出的评估依赖于在评估时可检查的合同或在操作循环中到达的反馈。我们研究了一个互补的场景:真实数据延迟、审查或私密,导致确定性代码无法在评分时检查正确性,而必须发出代码拥有的临时预测。RouteCast 实现了这种模式,针对模型生成的类型化战略路线:模型提出候选路线和结构化因素;在某一时刻的证据、参考类别和确定性变换生成临时预测排名;后续结果用于评估预测。
在针对 21 个二元结果案例(6 个正面,15 个负面)的回顾性试点中,整个数据包的 RouteCast 评分显示出初步的回顾性区分能力(AUC 0.756,95% CI [0.471,0.980]),而盲法 LLM 评估者的 AUC 为 0.678 [0.419,0.897],身份暴露的 LLM 评估者的 AUC 为 0.761 [0.515,0.944],这与识别或结果相关的泄漏风险一致。对相同二元子集的预注册分解消融研究发现,将相同输入转换为类型化分阶段路线与整个数据包评分无显著区别(Delta AUC = -0.144,95% CI [-0.471,0.176]),与确定性启发式方法也无显著区别(Delta AUC = -0.089,95% CI [-0.412,0.278])。该试点建立了可审计的可行性结果,并揭示了失败模式;但并未建立前瞻性校准、因果决策改善、路线分解优势或跨领域有效性。
博主点评: 本文探讨了在缺乏即时真实数据的情况下,如何通过代码生成的临时预测来评估模型的输出,展示了 RouteCast 方法在战略路线生成中的潜力。其结果为未来的模型评估提供了新的思路,尽管尚未达到完全的前瞻性校准,仍为进一步研究提供了基础。