再词化是临床自然语言处理中的关键技术,能够在屏蔽敏感信息的同时生成保留真实特征的数据集。然而,在转换过程中保持结构完整性、关系连贯性和时间一致性仍是难点。现有方法多采用独立实体替换,导致纵向记录出现临床不一致,削弱了再词化数据在后续科学分析中的价值。
为克服这些局限,我们提出了 G-RELIC(基于图的上下文再词化与改进一致性),将大语言模型的生成能力与图结构相结合。G-RELIC 通过图映射机制实现原始实体与替代实体的一对一对应,并引入确定性的时间重定位算法以保持时间线的一致性。
在多个真实临床数据集上的实验表明,G-RELIC 在关系完整性上提升了 30.4 个百分点(从 62.1% 提升至 92.5%),在时间一致性上提升了 45.9 个百分点(从 46% 提升至 91.9%),且未突破已认可的隐私安全基准。该方法在提升再词化数据分析价值的同时,最大限度降低了重新识别风险。
点评:G-RELIC 通过图结构约束和确定性时间处理,实现了临床文档再词化的高一致性,为后续研究提供了更可靠的数据基础。