在产品或政策正式上线前,最关键的问题是用户会如何响应。Augur 通过离线模拟来预演这种响应:它先从变更文档中构建带类型的知识图谱,再在一个具象化的角色市场中填充实体,随后运行交互仿真,最终生成可审计的决策备忘录,给出五种可能行动中的一种。我们收集了 Gold-50 数据集,包含 50 起真实的产品与政策案例,并依据公开记录标注了真实结果,用以评估模型的五路发布判决。核心发现是方法学层面的负面结论:前沿云模型与我们离线微调的开源模型之间的大部分性能差距来源于评估设定不明确,而非模型能力本身。我们通过三种方式展示这一点。第一,仅改变提示范围就能主导得分:在权重、案例和评分器固定的情况下,使用 Qwen3-32B 的 LoRA‑SFT 适配器,得分可从 0% 跳升至 73%。第二,在匹配的 2×2 消融实验中,仅在提示中明确决策分类——不改模型——即可让所有前沿模型提升 24~34 个百分点;在这种不明确的提示下,离线服务的 Qwen3-32B LoRA‑SFT 超越了三种前沿模型(配对 McNemar 检验,Holm 校正),而在公平提示下,各模型之间的差异不再显著。第三,教师模型的蒸馏一致性提升,但准确率未随之提升,完整流水线反而放大了系统性的“过度悲观”偏差,而非改进判决。我们还单独验证了反应层:四类模型的盲评人员发现,合成反应能够恢复 67%‑90% 的公众真实关切;预注册的消融实验表明,其价值在决策最困难的情形下最大,接近上限时贡献冗余。完整的数值与图表再现流水线已由作者公开。
点评:本文通过系统化的实验揭示了评估设计对模型表现的决定性影响,提醒研究者在比较前沿模型时必须统一提示与任务定义,否则容易误判模型能力。