NeFut Logo NeFut
EN 管理员登录

[AI学术] DataWeave:面向探索性结构化数据分析的人机LLM协作系统

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

Data journalism 越来越依赖记者在大型结构化数据上快速发现趋势、差异和问责信息。实际操作中,数据集变量众多、模式频繁变化、编码规则复杂,导致探索过程缓慢且脆弱。记者需要在假设演进的同时编写非平凡的分析代码,且常遭遇模式不匹配、语义误读、单位错误等 LLM 失效情形。

DataWeave 通过四个核心模块解决上述痛点:

  1. 对话交互层,允许用户以自然语言提出探索性问题;
  2. 模式对齐层,将对话内容映射到数据集的元数据(表、列、类型、单位),实现 schema grounding;
  3. 分析规划层,根据用户意图生成分析计划,包括统计描述、分组、关联等步骤;
  4. 可执行查询层,将计划转化为 SQL 或 Pandas 代码,并返回可审查的结果。

系统把 LLM 视为可检查、可纠正、可引导的伙伴,而非独立答案机器。用户可以查看生成的查询、修改字段映射或调整分析步骤,随后重新执行以验证假设。

在一次真实部署中,专业记者使用 DataWeave 对美国教育部的 Integrated Postsecondary Education Data System(IPEDS)进行探索。该数据集包含上千个变量且经常更新,具备复杂的教育层级和计量单位。记者通过对话快速定位感兴趣的子集,系统自动生成带有单位转换的 SQL,随后在交互式表格中验证结果,最终发现了某类院校在奖学金分配上的系统性差异。

部署过程中我们迭代了架构:最初的单轮问答被改为多轮对话;模式缓存从静态文件迁移到实时元数据服务;错误处理加入了对“schema drift”的自动检测。通过这些改进,系统在真实新闻编辑部的使用时长提升了 3 倍,错误率下降至 5%。

从本次工作可以提炼出三条设计原则:

点评

原文链接: https://arxiv.org/abs/2610.02679

[h] 返回首页