本文评估了Scientific Agents项目中503个职业特定的系统提示(AGENTS.md),使用Gemini 3.8 Flash通过OpenRouter在Pi agent框架下进行实验。对比了四种控制:最小基线("You are a helpful assistant"),简介中的角色句子,通用科学严谨指南,以及无关领域的配置文件。实验覆盖九个文本科学基准(共4,531个抽样问题,100个匹配配置文件),在API错误重试后完成5种条件的4,488项,使用自动规则评分。结果显示,配置文件相对于基线的平均准确率差为-0.6个百分点,95%自助区间[-1.5,+0.2],没有显著提升。配置文件产生的输出令牌是基线的1.5-2.3倍,成本是2.2-4.5倍。对60个使用工具的BioMysteryBench生物信息学问题(每种条件三次),基线解答率为56.7%,配置文件为46.7%,差异为-10个百分点,主要因为更频繁的令牌或时间限制中止。较长提示在SuperGPQA上意外提升:短基线首次正确率仅54.0%,而配置文件为71.6%,这可能源于提示长度或格式而非领域专业性。结论是,对所测试模型和任务,默认加载完整职业配置文件既不提升准确率,又显著增加成本;是否通过选择性检索或在开放式科学任务中使用仍待验证。
点评