摘要
LLM代理从上下文中选择工具和论据,这些上下文混合了用户请求、工具输出、检索记录、记忆和不可信文本。证据可能是相关的,但并不一定有权决定某个决策,因此正确的行动不必仅基于被授权的证据。
我们介绍了一种特定目标的授权审计方法,为每个工具和论据目标单独标记上下文因素。其主要测试保持任务、命题、立场和政策不变,仅改变命题的来源权威。接着,我们测试在有效证据减弱时的行为,并使用上下文子集交互作为次要定位诊断。
在450个受控的下一步行动任务和多个开放权重的LLM家族中,受信和不受信的变体在5.4%的竞争案例中产生不同的行动,而在支持案例中仅为1.7%。在受控降级下,未经授权的竞争在完全正确、混合错误、干净正确模式中保留在2.4%的比较中,95%的置信区间为2.1到3.0%。这些是受控压力集的比率,而非部署的普遍性。模型响应文本来源权威的线索,但这并未阻止不可信证据影响其行动。
博主点评: 本文探讨了LLM代理在选择行为时的来源敏感性,强调了不受信证据的潜在影响。这为理解模型的决策过程提供了重要视角,尤其是在实际应用中,如何确保模型依赖于可靠的信息源仍是一个亟待解决的问题。