统一的多模态大语言模型(MLLM)和多智能体系统推动了视觉生成技术的发展,但仍存在三大局限:① 现有方法往往只蒸馏任务特定经验,缺乏通用性;② 反思通常在任务完成后才进行,导致错误累积;③ 知识获取仅在下游任务需求出现时才触发。
为克服这些问题,本文提出 OmniHarness 框架,核心思想是将已验证的执行过程抽象为符号策略。符号策略保留共享的生成步骤和适用条件,去除具体实例输入,从而形成可复用的任务族模板。
OmniHarness 的 harness 负责在新任务出现时实例化、适配并组合这些策略。执行过程中通过中间验证检测偏差,指导策略细化并实现错误恢复。系统还能自行发起探究任务,在能力边界附近进行练习,提前发现并修正潜在缺陷,所有改进均在模型参数保持冻结的前提下完成。
实验在六个基准、三种 MLLM 主干和三种视觉智能体框架上进行。结果显示 OmniHarness 在 Creative 类任务的 ComfyBench 上实现 95.0% 的解答率,比最强基线高出 27.5 个百分点,并展示了持续的能力扩展。冻结的策略快照还能以即插即用的方式提升现有视觉智能体系统的表现。
点评