NeFut Logo NeFut
EN 管理员登录

[AI学术] 何时让视觉语言模型观察?仅为必要且使用的视觉调用付费

发布于:2026-09-23 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #optimization

视觉语言模型(VLM)在需要裁剪或放大图像时会发起视觉调用。传统的奖励机制只奖励成功的工具调用,却没有验证模型是否真的需要查看该图像,也没有检查返回的像素是否被实际利用。

在冷启动检查点,仅有约 10%~12% 的视觉调用既是必要的又被使用,而在多个基准上,已发布的模型会出现 36%~87% 的无效调用。结果奖励、评审奖励和分支探针各自只能捕捉到问题的一面,约三分之二的奖励实际上流向了既不必要也未被使用的调用。

CounterCredit 方法在每一次返回图像的调用前,使用策略自身的金答案分数同时提出两个问题:该调用在当前状态下是否真的必要(决策值),以及返回的裁剪是否优于随机同尺寸补丁(证据值)。如果调用在两方面都通过验证,则获得返现;否则每一次执行的调用都需要支付租金。价格上限被设定,使得任何正确的轨迹的累计收益都超过错误轨迹,双通道 GRPO(Generalized Reward Policy Optimization)进一步确保价格以自身单位保持平衡。

在相同的冷启动、提示池和预算条件下,CounterCredit 在 V* 上达到 89.5%,在 HR‑Bench‑4K 上 80.2%,在 HR‑Bench‑8K 上 76.4%,比仅使用结果奖励的 GRPO 提高了 6.3~9.4 分,平均每题调用次数从 1.84 降至 1.78,且无效调用率降至 31%~36%,是所有评测模型中最低的。同样的策略还能将 Qwen3‑VL‑8B 基础模型的平均得分从 75.4 提升至 80.8。

该工作表明,仅在真正需要且被利用的视觉信息上付费,可以显著提升 VLM 的效率和性能,避免了大量冗余的视觉调用。

点评:CounterCredit 通过双重验证机制和经济激励,将视觉调用的必要性与使用率紧密结合,为下一代视觉语言代理提供了更精细的奖励框架。

原文链接: https://arxiv.org/abs/2609.22910

[h] 返回首页