NeFut Logo NeFut
EN 管理员登录

[AI学术] 数据优先本体模型:DaoQL多模态存储验证与反事实推理评估的突破

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#algorithm #AI #Machine Learning

摘要

大型语言模型在神经权重中隐式编码了世界模型,这在医疗和金融等高精度领域暴露出四个结构性风险:幻觉、知识冻结、解释性差和可修改性差。本文提出了数据优先本体:将大型语言模型视为推理和语言引擎,而将确定性知识移入一个显式的多模态数据库DaoQL。

我们形式化了一个显式的世界模型,并展示了在规则独立性、确定性评估和固定冲突解决下,显式模型提供了可组合反事实可分解性的充分条件;隐式模型缺乏原子读取/增量语义,因此没有可比的架构保证。实现的系统专注于DaoQL的验证存储层和显式评估路径,将图形、列、向量和全文引擎集成于一个过程中。

KVCache图节点、专家热更新和DaoQL-Agent运行时仍为未来工作。在嵌入的同机设置中,DaoQL报告图BFS为1.20毫秒,HNSW为83.1微秒,流畅的混合查询为105.8微秒;这些结果表明了工程潜力,但必须考虑到与客户端-服务器系统之间的部署形态差异。对LDBC SNB SF1和ANN-Benchmarks的探索性测量进一步显示,在交互类查询中,34/34查询覆盖率大部分在亚毫秒到毫秒范围内,但由于长尾BI/IC查询,整体仅为1.8 QPS;ANN-Benchmarks在桥接边保护修复后达到Recall@10 = 99%的千级QPS。

在五个领域的反事实实验中(n = 1250),DaoQL+GPT-4o实现了94%的可组合反事实可分解性,比单独的GPT-4o高出49个百分点。本文明确区分了可证明的结构、初步的实证证据和架构路线图声明。

博主点评: 这项研究通过将确定性知识转向显式存储,显著降低了大型语言模型在高精度领域的风险。DaoQL展示了高效的查询性能,并在反事实推理中提供了优越性,值得关注其在实际应用中的推广潜力。

原文链接: https://arxiv.org/abs/2607.17269

[h] 返回首页