NeFut Logo NeFut
EN 管理员登录

[AI学术] IBBench-Light:外部指令条件响应的配对评估

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#AI #Machine Learning #LLM

IBBench-Light 旨在同时评估模型对同一记录的两类外部指令:执行(apply)和阅读(read)。通过 12 种语义基底,每个模型产生 144 对匹配的响应;四个量化指令模型共生成 1,152 条贪婪响应。

配对精确契约准确率(PECA)要求配对中的两条响应均满足各自的输出契约。Qwen 在 132 条执行提示和 109 条处理提示上取得成功,但完整配对仅有 97 对,揭示了单独平均值可能掩盖的细节。

我们审计了字面目标暴露和大小写归一化,并加入 1,722 条记录的 CPU 生成用于指令缺失的对照实验,扩展至 12 种额外语义基底、基底内部措辞变化以及生成停止策略。

在固定 Phi 的复现中,修改结束符(EOS)集合使配对成功率从 0/144 跃升至 62/144。随后进行的受限 IHEval 对比使用相同的 SmolLM2 检查点和输出预算,同时保持其公开的指令角色和评分器。该基准衡量条件任务和输出契约的成功率,任务边际和配对计数必须结合停止策略一起解读。

点评:IBBench-Light 通过配对视角揭示了模型在不同指令下的细粒度表现差异,强调了停止策略和输出契约在评估中的关键作用。

原文链接: https://arxiv.org/abs/2609.13725

[h] 返回首页