自然语言分析在企业数据仓库中的需求日益增长,但实际部署常受幻觉指标、无效连接、错误粒度、不安全的数据访问以及缺乏解释等问题制约。传统的 text‑to‑SQL 系统主要依据数据库模式或检索到的文档进行约束,而企业报表还需要受治理的业务语义——经批准的度量、维度、连接路径、过滤条件以及行级安全策略。
GROUND(Governed Retrieval Over Unified Normalized Definitions)提出了一套框架,将 LLM 生成的分析限定在受治理的语义层上。框架首先提供统一的、经批准的定义库,然后将用户意图映射到这些受治理的度量和维度上。随后,系统在执行前对生成的 SQL 进行多维校验,包括模式匹配、度量一致性、连接合法性、粒度匹配、过滤规则、行级安全以及成本约束。若检测到违规,系统会尝试重新生成或直接放弃执行。
在一个包含 100 条合成企业报表问题的基准上,GROUND 与仅基于模式的 text‑to‑SQL、模式‑RAG 以及仅语义约束的三种对照系统在同一模型下进行比较。结果显示,GROUND 在六类幻觉指标上全部为零,未出现任何违规;而未受治理的系统在多题目上违反了行级安全。即使在仅提供精确度量定义但缺失访问策略的语义约束条件下,仍会出现数据泄露,说明治理不可被单纯的度量准确性取代。
该实验在真实的美国 NHTSA 车辆安全数据集上复现,并使用独立手工标注的金标准进行验证。进一步在四种模型(来自三家供应商)的对抗性测试中,GROUND 对过滤条件和行级安全的强制保证在所有模型上均保持零违规,但对“拒绝未定义度量”等判断依赖的行为仍存在一定不确定性。
博主点评:GROUND 展示了将业务治理层嵌入 LLM 生成流程的可行性,尤其在安全敏感的企业环境中提供了可靠的防护。未来可进一步完善对模糊意图的判别以及成本优化策略,以提升实用性。