我们推出 Crypto Accounting Bench(CAB),用于检验前沿模型和开源权重模型能否完整重建组织对一次加密资产交易实际记入的分录。CAB 包含 118 条评估任务,来源于 7 家匿名组织,每条任务融合了交易机制、资产数量、基础货币价值、钱包与法律实体上下文、对手方证据、关联交易腿、重复性、税批证据以及组织完整的科目表。目标是生成一个平衡的结构化分录,必须包含每个必需的科目、借贷方向、金额、币种和全精度资产数量。我们对 12 种模型进行评估,针对每个任务进行 3 次独立尝试,共计 4,248 条生成轨迹。报告了三项指标:Mean Score、Best@3 和 Pass@3,其中 Pass@3 表示在 3 次尝试中至少有一次满足所有评分标准和必需门槛的任务比例。最佳模型取得 77.43% 的 Mean Score,最高 Pass@3 为 56.78%。基于每任务 3 次尝试中最佳结果的确定性诊断显示,基础金额一致率为 97.8%,而决定科目准确率为 56.3%。结合失效分析,这些结果表明科目选择和完整分录构造仍是 CAB 上的主要挑战。
点评:CAB 为评估语言模型在真实财务场景中的细粒度能力提供了严谨基准,未来工作应聚焦提升模型的科目推理和全局分录组织能力。