生成式 AI 让自然语言查询大规模数据中心和工业 4.0 的数值遥测成为可能,但现有的文本到查询以及工具使用代理仍不可靠。即使是最前沿的模型,也只能正确回答约一半的真实数据库问题,面对需要多步操作的实际任务时成功率更低,因为大语言模型必须自行推断异构数据源之间的关联,而往往会捏造关系而非仅仅字段。我们提出 符号分离 的思路:深度代理可以自由推理,但对数据的实际操作只能通过一个受本体约束的虚拟知识图谱(Virtual Knowledge Graph)完成,并在执行前进行确定性的验证。与传统工具 API 的接口合约不同,这种领域语义合约把复杂的问题转化为一次经过验证的图遍历,而不是让 LLM 推断连接方式。我们将该思路实现为 Neurosymbolic Deep Analyst,在 49.9 TB 超算遥测数据上进行评估,使用严格的工作流对比非符号化消融实验。实验结果显示,端到端任务成功率从 43% 提升至 86%,能够阻止仅靠语法检查捕获不到的静默数据完整性错误,并将 token 消耗降低 2.4 倍,使得体积更小的本地部署模型能够超越更大的模型。$$\text{Success Rate}_{\text{symbolic}} = 86\% \quad \text{vs.} \quad \text{Success Rate}_{\text{non‑symbolic}} = 43\%$$
点评:符号分离通过本体约束的图遍历,为深度代理提供了可靠的数据访问路径,显著提升了实际业务场景中的准确性和效率。