摘要
大型语言模型(LLM)代理通过代理技能不断扩展,这些技能是将自然语言元数据、过程指令和执行时资源打包以供运行时使用的可重用构件。随着开源技能市场的扩展,用户和代理越来越依赖简短的元数据来选择第三方技能,这使得检测技能描述与其真实行为之间的不一致变得困难,我们称之为跨层不一致。
为了解决这个问题,我们提出了进阶加载感知层次对比学习(PL-HCL),这是一个基于LLM的框架,通过建模代理技能的分层结构并学习跨层一致性来检测不一致性。使用超过264,000个开源技能的标准化语料库和一个经过人工验证的挑战集,PL-HCL将未适配基线的Macro-F1从约0.45提高到评估的LLM骨干的0.87-0.89。这种方法为用户和操作员提供了有效的筛选工具,同时也为检测分层数字工件中的不一致性提供了设计原则。
博主点评: 该研究通过引入PL-HCL框架,显著提升了大型语言模型在代理技能一致性检测中的能力,为开源技能市场的可用性和可靠性提供了新的保障,值得关注其在实际应用中的推广潜力。