多代理流水线需要同时读取请求者的表单并据此撰写正式文档。我们报告了一个已部署的投标响应系统,该系统在主权约束下运行开源权重模型,并将其输出与同一组织实际提交的人类投标进行比较。
在盲测中系统没有可用的工作示例,LLM评审员在$55$个真实章节中认为系统答案至少与人工答案等同的有$40$个,表现更好$4$个,未出现缺失,仅发现一次不支持的主张。
对评审员标记的每个缺口进行分类,发现$68\\%$是系统自身来源中缺失的内容——即人类作者拥有但管道未提供的知识——因此只有$15$个不利判决中的$6$例是系统本可以避免的缺陷。偏离真实答案更多是信息可得性问题,而非写作质量问题,未区分两者的评估会低估此类系统。
在此背景下我们发现条件化存在非对称性。已知将文档表示为结构化标记而非平面 prose 能提升信息抽取,我们在三项阅读任务中复现了这一点。但这种优势并未转移到条件化:将投标的 \emph{instruction} 材料从 prose 转为嵌套 XML,在配对比较中答案质量从$74\\%$跌至$48\\%$。
进一步实验表明,明确禁止某种构造会导致其集中出现——$96\\%$的剩余缺陷出现在提示明确列出的两种形式中——并且将随机标注与确定性窗口函数耦合,会使在字节相同的文件上提取的需求数量从$68$下降到$51$。
因此,结构化应用于模型读取阶段, prose 与自检应留给写作阶段。
博主点评:该工作揭示了阅读与写作阶段对结构化的不同需求,为多代理文档生成系统的设计提供了实用指引。