合成表格数据能够匹配真实数据的分布,但仍可能违背约束有效行的语义规则。这暴露了现有表格生成器的核心缺陷:它们主要优化分布相似度,却未显式建模表格模式和文本描述中蕴含的弱语义先验。
为此,本文提出一种语义一致的表格扩散框架(记作\ours),在弱语义先验下实现高保真合成。\ours 首先利用大语言模型从元数据中抽取两类先验——列内语义和列间符号规则,并在真实训练集上进行验证。这些先验被直接用作生成条件,而非事后过滤。
框架将异构列值、列身份以及语义先验映射到统一的语义空间,随后执行列级前向噪声腐蚀和先验条件化的逆向去噪。该过程既保持边缘分布,又遵循跨列规则依赖,实现了分布保真与语义一致的双重目标。
在六个真实表格基准上的实验表明,\ours 在分布相似度、语义一致性以及下游任务效用方面均优于代表性的 VAE、GAN、LLM 和扩散基线。进一步分析显示,即使部分语义先验缺失,\ours 仍能保持稳健性能。
点评