合成医学时间序列能够缓解数据稀缺问题,为临床预测模型提供可靠的训练数据。现有方法主要关注整体分布和时间动态的匹配,却未必能提升在类别不平衡数据上的下游效用。临床上有价值的模式往往出现在不同的时间尺度上,少数类特征容易被多数类主导模式淹没。
为了解决上述挑战,本文提出 MedFlow,一种面向类别的多尺度流匹配框架。MedFlow 使用向量量化的多尺度分词器,将医学序列在互补的时间分辨率上进行编码,既捕获粗粒度的临床趋势,又保留细粒度的动态细节。
在此基础上,引入 Token Marginal Guidance(令牌边际引导),将类别条件的令牌统计直接注入流匹配过程,使生成过程倾向于学习到的类别特定令牌空间。该机制在强化少数类模式的同时,保持了真实数据的全局分布和尾部分布。
在四个公开数据集(包括电子健康记录、EEG 与 ECG)上的实验表明,MedFlow 在下游预测任务上始终优于最新的基于扩散的基线。平均提升 AUPRC $5.8\%$,将 Context‑FID 降低 $88.6\%$,并实现 $3.8\times$ 的采样吞吐提升。
点评:MedFlow 通过多尺度令牌表示和类别感知的流匹配,有效解决了医学时间序列合成中的尺度异构和类别不平衡问题,为高效且具下游实用性的合成数据提供了新思路。