NeFut Logo NeFut
EN 管理员登录

[AI学术] SQL-Zero:自演化文本到SQL

发布于:2026-09-07 22:00 最后更新:2026-09-08 00:37
#Machine Learning #LLM #Artificial Intelligence

训练竞争性的 Text-to-SQL 代理通常需要人工标注的自然语言/SQL 对,成本高且受限于领域。本文展示了在没有任何标注对的情况下也能训练出竞争力的求解器。

引入 SQL-Zero,一个提议者‑求解器自博弈框架。挑战者和求解器均从同一基础大模型出发,唯一的真值来自对数据库的执行结果。挑战者生成的 SQL 与求解器当前难度匹配(目标“难但可解”),两者交替使用 GRPO 更新,并在挑战者层面加入模板级重复惩罚以防多样性崩塌。

在 BIRD 数据库上不使用标签进行自博弈训练,3B 参数模型在 BIRD dev 上比零-shot 基线提升 6.6 分,7B 提升 7.3 分。与在相同数据库上使用人工 BIRD gold 进行相同流程的对照组相比,SQL‑Zero 也取得更高得分,尽管配对检验未显著区分差距。

在 3B 规模下,每一次迭代在未见过的 Spider 数据库以及词汇扰动的 Spider‑Syn 上均优于基线,并且退化程度低于 BIRD‑gold 对照组;而在 7B 规模时,仅首轮迭代保持了迁移能力。

通过自博弈和执行反馈,SQL‑Zero 实现了零标注的 Text‑to‑SQL 学习,为跨数据库扩展提供了新的路径。

点评

原文链接: https://arxiv.org/abs/2609.04697

[h] 返回首页