在构建可靠的 AI 智能体时,上下文工程已成为核心要素,但其测量仍然较为薄弱。智能体并非孤立失败:它们的行为受到指令、工具、记忆、检索知识、护栏以及不可信输入等上下文因素的影响。
当上下文薄弱时,智能体可能会偏离目标、产生幻觉、滥用工具、忽视约束、易受注入攻击,并浪费代币。本文验证了上下文工程质量作为智能体可靠性的独立领先指标。
我们在开放源代码基础设施 ProofAgent-Harness 中实现了这种测量,该基础设施用于 AI 智能体评估,采用多评审者、基于共识的评分方式。该评估工具基于七个标准评估上下文的质量:角色清晰度、护栏覆盖率、指令一致性、工具模式质量、基础充足性、注入强化和代币效率。
重要的是,上下文评分与行为指标和发布决策相互独立,从而实现了非循环的验证。
通过在受监管的智能体领域进行的控制上下文质量研究,我们固定前沿 LLM 智能体,仅改变其操作上下文,结果表明上下文质量标准一致地预测其相应的行为结果。
基础充足性预测幻觉抵抗能力,护栏覆盖率预测操控抵抗能力,指令一致性预测遵循指令的能力,而工具模式质量则预测工具的使用。这些发现确立了上下文测量作为智能体可靠性的验证前信号,并将上下文工程定位为智能体评估和治理的可审计层。
博主点评: 本文深化了对 AI 智能体可靠性的理解,强调了上下文工程的重要性。通过系统的评估标准,研究者为智能体的设计和治理提供了新的视角,值得关注和应用于实际场景中。