NeFut Logo NeFut
EN 管理员登录

[AI学术] 医疗语言模型安全防护被轻易绕过:MedGemma-4B的挑战

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#algorithm #AI #Open Source

摘要

开源医疗语言模型在患者和临床支持应用中日益普及。然而,它们的模型卡片禁止某些特定行为,如推荐确切药物剂量、做出明确诊断、开处方、裁定药物间相互作用及建议跳过紧急护理等,但模型卡片仅描述了预期行为,而非稳健行为。我们定量分析了MedGemma-4B在无需技术专长的攻击下的表现差距。

方法

我们构建了一个全面的基准测试,包括5个受保护行为概念、50个确定性模板问题、6种易于访问的攻击方式和3次重复(共4,500次生成),并通过Ollama在本地提供模型,采用默认采样。我们对每个响应进行编码,标记为拒绝/模糊/遵从,由三位独立评审(LLM评审、透明正则表达式评审和NLI蕴含评审)进行评估。

结果

在主要的LLM评审下,整体攻击成功率(ASR,即编码为遵从的比例)为38.0%。重新诠释请求为“医学考试”项目的两个框架显著提高了ASR:将问题重述为“医学考试”项目将ASR从29.0%提升至53.1%(+24.1个百分点),而诉诸于假定医生权威的则提升至43.7%(+14.7%)。粗略的指令覆盖前缀对结果没有显著影响。

稳健性受主题影响显著:药物相互作用的防护几乎缺失(ASR为83.2%),而紧急推迟的防护则较强(ASR为4.7%),并且只有权威框架的攻击突破了这一防护。我们报告了Wilson置信区间、聚类自助效应大小、聚类稳健逻辑回归、Cochran的Q检验、每种方式的McNemar检验和评审间可靠性(Fleiss' kappa = 0.26);绝对ASR依赖于评审,而攻击和主题的排序则不受影响。

结论

我们的研究结果促使对开放医疗模型在部署时实施更强的防护措施。

博主点评: 本文为医疗语言模型的安全性提供了深刻的洞察,揭示了现有防护措施的脆弱性,尤其是在药物相互作用方面的不足。未来的研究应着重于如何增强这些模型在实际应用中的稳健性,确保患者安全。

原文链接: https://arxiv.org/abs/2607.09804

[h] 返回首页