奖励最大化的对齐方法主要通过调节离散扩散模型的逆过程来实现,常见做法是改变 token 的 logits 或在中间步骤挑选更有利的序列。这类方法把推理视为单向过程,缺乏对已生成不佳 token 的重新审视机制。\ \ 我们提出 光谱反馈(Spectral Feedback),它在一个反馈回路中选择需要编辑的位置,让模型能够迭代地纠正自己的生成。该算法利用离散扩散模型的 mask 结构,通过重新 mask 并重新采样 token,实现类似图像编辑中重新注入噪声并再次运行逆过程的效果。\ \ 与以往关注“给哪个 token 打标签”以最大化奖励不同,光谱反馈把“哪些 token 需要重新访问”作为核心对齐问题。编辑位置的选择十分困难,因为编辑效果相互依赖:修改一个 token 的影响取决于同时编辑的其他 token。我们将一次需要重新 mask 的位置集合称为 edit‑set。受生物系统稀疏交互研究的启发,我们实验证明蛋白质逆折叠任务的 edit‑set 价值函数可以用稀疏傅里叶展开近似: $$ V(S) \approx \sum_{k\in\mathcal{K}} a_k \cos(\omega_k \cdot S) $$ 其中 $S$ 表示 edit‑set,$\mathcal{K}$ 为少数非零频率索引。稀疏性使得光谱反馈能够高效学习并优化该价值函数,从而快速挑选出最有价值的编辑位置。\ \ 光谱反馈对模型无特定要求,可直接作用于预训练模型、测试时对齐的模型以及经过强化学习微调的模型,且不改变底层生成过程。实验在蛋白质稳定性奖励 oracle 上进行,对比结果显示:预训练模型的稳定蛋白比例提升 32.3%,Best‑of‑10 提升 24.8%,最先进的 RL 微调扩散模型提升 5.8%。\ \ 点评