LLM 污染指合成回复混入用于捕获人类行为的数据中。过去由于部署成本高,自治调查代理的风险受到限制。随着开源权重模型与开源代理框架的结合,这一道槛被打破。我们评估了九种代理配置,涵盖完全开源到闭源商业的不同方案。每个代理在无需使用费用的本地环境下独立完成包含多种回复类型的调查,并接受多项检测检查。结果显示,完全开源代理的性能与商业方案相当。开源和商业代理在不同检查上失效,单一检查无法可靠捕获全部代理,但开放文本回复在区分代理与人类方面表现最佳。研究表明,完全开源代理构成了LLM 污染的独特风险,建议采用多层检测策略,重点分析开放文本。
点评