Agent harness 在每个任务中需要做大量小的、类型化决策:调用哪个模型、使用哪种工具、检索文本是否相关、输入是否包含注入。System‑1 决策模型只用一次前向传播输出类别概率,理论上可以大幅降低成本和延迟。我们对开源权重的 Laya 与托管的 Jev 两个 System‑1 模型在 11 个决策点进行配对评估,数据来源于 18 份公开材料,包含 7,283 条基线案例和 6,640 条鲁棒性变体,所有输入字节相同,进行配对测试并检查跨硬件、跨天的可复现性。
结果显示 Jev 在 9/11 决策点显著领先(提升 10.8~46.0 个百分点),两模型在零样本模型路由上均未超过随机水平,在 RAG 相关性门控上持平。Laya 在选项顺序翻转时改变 30% 的答案,在候选数量增多或相似度高时表现急剧下降(在 50 个最近邻工具时错误率 31%,而 Jev 在唯一正确工具的项目上错误率仅 2%)。
我们还审计了自己的流水线,发现三处分析错误和一处设计混淆导致标题声明失真:遗漏预筛选成本(报告节省 23.9%,实际 4.3%),将门控准确率误报为端到端质量(58% vs 98%),样本内阈值设定(目标 5%,持出数据漏检最高 17%),以及注入误报的“通道效应”在使用原生通道内容时消失。其他两项潜在混淆未改变结论。所有案例、原始输出和分析代码已在 https://github.com/David-DL-Space/sys1-eval 公布。
点评