世界模型通过模拟环境并预测在动作下的演化,已在机器人等实际应用中广泛使用。复杂系统同样需要此类工具,因为单个动作的直接影响往往微弱,关键在于随后若干步骤的整体结果。例如,在营销活动中选取种子节点,或在疫情防控中对节点进行免疫,单次干预的变化有限,真正决定效果的是随后的扩散过程。为此,需要设计算法在每一步评估候选动作的预期收益,这通常依赖大量模拟,导致计算瓶颈。
我们提出一种动作条件化网络世界模型(action‑conditioned Network World Model),它在时间维度上学习网络在干预下的扩散动力学。模型接受当前网络状态和待执行的动作,输出该动作随后产生的扩散结果。该模型可作为算法设计循环中的快速评估器,配合编码代理(coding agent)在完整回滚、动作级信用以及对替代干预的反事实探测的反馈下,迭代生成并优化可执行算法。
在八个网络任务和五种扩散模型的实验中,基于该模型设计的算法在 138/141 的设置中匹配或超越了已报告的最强基线,并实现了相较于蒙特卡洛模拟最高 14.5 倍的加速。代码将在论文接受后公开。
点评