本文研究了四大对话平台(ChatGPT、Claude、Grok、DeepSeek)中 LLM 代理的网页搜索行为。通过真实用户交互(in‑vivo)和同平台模型 API 的受控实验(in‑vitro)相结合,分析了搜索决策质量、查询构造策略、搜索结果的领域偏好以及将结果转化为有依据回复的选择。
结果显示,不同平台和模型的搜索调用频率差异显著,调用更频繁并不必然提升回复质量。代理在查询时会使用多轮、组合、限定等复杂策略,平台自带搜索引擎倾向返回其偏好的域名。
回复大多基于检索结果,但仍有部分陈述未标注来源,导致可追溯性和可靠性风险。研究对未来面向对话检索的 AI 代理和搜索工具设计提供了参考。
点评