工业场景下,查询到代理的匹配常因把主题相关性误认为可执行能力而失效,尤其在长尾和边界敏感的请求上。我们将标注任务形式化为能力约束过程监督,并实现了 Debate-to-Skill 框架。该框架通过可复用的决策原则、结构化的辩论流程、基于验证器的判决抽取以及基于分歧的迭代改进,实现对能力关键决策过程的直接监督。实验在工业 Query2Agent 基准上进行,比较了 Debate-to-Skill、直接标签监督、推理 SFT 以及若干结构消融。结果显示,在语义相关性与可执行能力出现分歧的灰色区间,监督能力决策过程本身能够显著提升匹配准确率。
点评