摘要
参数化检索使得大型语言模型(LLMs)能够通过为每个API分配唯一的虚拟标记来隐式检索工具,并通过约束束搜索训练模型生成这些标记。然而,Toolsense表明这种机制存在两个关键缺陷:在训练过程中破坏了参数化工具知识,并且束搜索解码速度对于实时部署来说过于缓慢。
我们提出了TRACE(通过增强的思维链和企业规则进行工具检索),这是一种两阶段课程,解决了这种知识脱离问题。第一阶段重用了来自ToolSense的多格式记忆SFT,以LoRA技术为工具知识提供种子。第二阶段是我们的核心贡献:模型被训练为在生成工具标记的JSON列表之前输出思维痕迹,使用两个数据源——来自ToolSense的RRB对和由领域专家策划的针对业务规则的合成查询——这两者都增强了推理痕迹。这一训练目标在保持第一阶段多项选择和问答探测准确性的同时,使得单束贪婪解码能够在生产延迟下实现。
在对包含8300多种工具的企业目录进行评估时,TRACE的第二阶段训练不仅保留了工具理解能力,还有所提升:多项选择准确性提高了3.2个百分点,问答探测提高了9个百分点。TRACE在检索方面在A领域达到了约86%的召回率,在B领域达到了约60%——相比之下,嵌入基线的性能分别为约27%和52%——两者均采用单束贪婪解码,使其能够在生产延迟下直接部署。
博主点评:TRACE通过引入增强的思维链和企业规则,显著提升了参数化工具检索的效率与准确性,为大型语言模型的实用化提供了新的思路。其在保持知识的同时加快解码速度,为实际应用场景奠定了良好的基础。