NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于轨迹感知的扩散视觉语言模型解码控制

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #Machine Learning #Neural

扩散视觉语言模型通过迭代细化生成答案,过程会留下中间答案轨迹,可在推理时检查并干预。由于所有问题共用统一的生成步数,导致推理需求与控制不匹配:对视觉闭合型问题,答案稳定后继续细化会削弱效果;对需要推理的问题,过早提交会导致错误。我们将此称为推理预算不匹配,并在 LLaDA‑V 上进行研究。我们提出一种无需额外训练的控制器,根据答案闭合、提交证据和表征修正压力等轨迹信号,将每个样本路由至提前提交、保持基线或支持推理的解码模式,且不依赖真实答案。实验在答案聚焦、混合推理和链式思考敏感的基准上显示,路由控制比固定长解码、纯短解码或单一规则干预更稳健,提升并非仅来源于输出更短。闭合样本多受益于提前提交,链式思考样本则需要保留或支持中间推理。整体结果表明,扩散 VLM 的解码应依据观察到的轨迹状态动态选择控制策略,而非统一的解码长度。

点评:该工作展示了基于轨迹的解码路由能够显著提升不同推理需求下的鲁棒性,为扩散视觉语言模型的推理控制提供了新思路。

原文链接: https://arxiv.org/abs/2609.11315

[h] 返回首页