生产环境的代理系统需要从不断增长的技能库中发现并排序,找到最适合用户任务的技能。小规模时,这种选择在上下文中完成:LLM 规划器直接在系统提示中挑选已暴露的技能表示,而不使用显式的基于嵌入的检索步骤。我们将这种上下文内选择视为大规模嵌入检索的 small‑N 对应,并以 Tinycloud——一个面向多模态视频的生产代理系统——为例,探讨其如何为规划器表示技能。
该系统的技能以两种常见形式出现:
- 工具技能(tool‑skill)封装单个外部 API 或系统工具,充当原始词汇;
- 工作流技能(workflow‑skill)组合多个工具技能调用并渲染模板,以生成命名的交付物。
在系统提示中,这两类技能通过两种表面暴露:
- 内联体表面:为自动加载的技能提供完整指令、脚本或模板;
- 单行列表:为按需调用的技能提供一行简要描述。
我们在六个任务上进行选择消融实验,分别在三种曝光策略下评估:全部开启(all‑on)、默认策略(default)和全部关闭(all‑off)。结果显示:
- 全部开启时,规划器在每个任务上都能选中金标准技能;
- 全部关闭导致执行变慢并出现明显的发现失败;
- 默认策略下出现一次误路由,因为某个工具技能的词汇信号与一个工作流技能冲突,吸走了规划器的注意力。
核心发现是,提示中技能的曝光并非单调有益:部分曝光会产生词汇竞争,抑制正确选择。我们将这一 small‑N 观察与近期大规模基于检索的技能路由工作联系起来,强调本研究更像是案例而非基准。
博主点评:该案例提醒我们,在设计提示时要慎重考虑技能的呈现方式,避免因词汇冲突导致检索失效,尤其在多模态系统中更需平衡自动加载与按需列出的比例。