在全球范围内,电子表格应用被数亿人使用,但编写公式依然是一个显著的障碍。现有方法依赖于静态的监督数据,容易在有限的标注上迅速饱和。本文引入了 FORMULASPIN,一个自我博弈框架,打破了监督微调的限制,使得在没有额外数据的情况下实现迭代自我改进。
传统的 SPIN 方法在此任务中表现不佳,因为它均匀惩罚每一个不匹配的输出,导致在一个实例中执行等价的替代方案被视为负样本,而在另一个实例中又作为真值,产生矛盾的梯度。我们的框架通过利用公式生成的独特优势来解决这个问题:二进制可执行性提供了隐式监督,将语义错误与有效的风格变体分开。
我们将训练框架构建为一个双人游戏,主要玩家学习优先选择真实公式而非其先前版本的输出,同时执行反馈将输出分为不同的粒度,从而实现自适应课程,逐步从语义正确性转向风格优化。为了进一步提高准确性,我们引入了 ExecVote,一个语义级别的投票机制,能够自然处理多个有效的公式表达。
在多个基准上的实验表明,FORMULASPIN 达到了最先进的性能,在 NL2FORMULA 上的精确匹配率为 74.9%,执行准确率为 87.1%,与使用额外偏好标注训练的模型相匹配,同时超越了传统的 SFT 和前沿的专有模型。这些发现强调了自我博弈在解决稀缺数据任务中的潜力,并为将其扩展到可执行领域之外打开了大门。
博主点评: FORMULASPIN 的自我博弈框架展示了在缺乏数据时如何创新性地提升模型性能,其独特的训练机制和 ExecVote 机制值得关注,为未来的 NLP 任务提供了新的思路。该方法的成功可能会激励更多研究者探索自我博弈在其他领域的应用。