摘要
大型语言模型(LLMs)越来越多地融入临床工作流程,这使得对模型生成输出的可靠追溯变得至关重要,水印技术应运而生。然而,大多数水印的评估是在通用基准上进行的,医学等领域的研究相对缺乏。
在这项工作中,我们首次系统性研究了LLM水印对医学性能的影响,基准测试了5种水印方案在11个LLM和7个VLM上的表现,涵盖了单模态和多模态临床推理的各种任务。
重要的是,我们通过引入一个经过人类专家验证的流程,系统审计医学推理质量、术语精确度和诱发的幻觉,来补充现有评估。我们的结果表明,水印可能导致多个失效模式的显著退化,包括词汇损坏、幻觉术语以及图像发现的错误归属或遗漏。
值得注意的是,我们发现缺乏特定领域的分析,加上聚合指标未能捕捉临床文本固有的失效,可能会系统性掩盖水印引发的实际退化。我们的研究结果表明,特定领域的评估是安全部署水印模型于医学领域的前提,因为当前基准可能掩盖临床上重要的失效。
博主点评: 这项研究强调了水印技术在医学领域应用的复杂性。通过引入领域特定的评估标准,研究揭示了水印可能引发的潜在风险,尤其是在临床文本中。未来的研究应关注如何设计更为精确的水印方案,以确保医疗决策的安全性与有效性。