摘要
LLM 作为评判者在闭环再生中广泛应用于提供反馈和选择信号,但其有效性尚未得到充分验证。我们在表格识别领域进行研究,使用确定性 TEDS 评估提供了一个受控的测试平台,应用于 FinTabNet 和 OmniDocBench。
主要发现
-
评判信号的弱性:在两个数据集中,评判信号表现不佳:分数经常相同,排名不可重复,唯一在两个数据集中超过随机选择的策略依赖于最早迭代的平局规则,因此其优势不能仅归因于评判分数。迭代产生了更好的候选项,但评判者未能识别它们。
-
严重损失的发生:即使没有特定的评判反馈,严重损失依然显著。结构保持指令在 FinTabNet 上显著降低了严重损失率,并且在 OmniDocBench 上呈现出方向一致性。这些对比结果支持在无约束再生下目标保持失败作为观察到的严重损失的近因机制。
-
结构保持约束的影响:结构保持约束降低了严重损失的尾部,但未产生改善。在一次探索性的 2x2 分析中,当保留评判反馈时,未稳定观察到相同的保护效果。
这些结果并不否定 LLM 作为评估者的价值,而是表明评估能力并不意味着优化效用。迭代精炼至少需要一个验证信号,能够确定性地检测结构变化,而不仅仅依赖评判分数。
博主点评: 本研究揭示了 LLM 在闭环系统中的局限性,强调了评估与优化之间的差距。尽管 LLM 能够提供反馈,但在真正的优化过程中,仅依赖评判分数可能不足以确保效果。这为未来研究指明了方向,需关注更有效的验证机制。