在现代社交媒体和数字健康服务中,人工智能(AI)技术作为基础性推动者,同时也在虚假信息传播中扮演复杂角色。在非英语环境和低经济社会群体中,有限的数据使得有效的AI模型训练面临挑战,导致文化和语言多样性(CALD)社区难以通过AI工具获取可靠的健康信息。当前的AI工具因缺乏训练数据而表现不佳,且在非英语环境中无法考虑语言细微差别和传统。
为了解决这些问题,本文提出了一种面向CALD的AI健康虚假信息检测器,并为医疗专业人员提供了一个分析虚假信息的仪表板,这是缓解CALD人群日益关注的关键步骤。我们使用孟加拉语翻译的健康虚假信息数据集,进行一系列实验以评估各种小型语言模型(SLMs)的表现。SLMs在此背景下尤为重要,因为大型语言模型(LLMs)常因缺乏特定领域知识和高昂的资源消耗型微调成本而表现不佳。
实验结果表明,Phi-4模型在索引提取中实现了精确度与召回率的理想平衡。为了缓解SLMs的局限性,我们设计并测试了一种新的健康虚假信息检测框架,基于负责任的自然语言处理(NLP),该框架考虑了文化敏感性、潜在危害和交流质量,从而为评估低资源语言中的虚假信息提供了全面视角。
博主点评: 本文通过结合小型语言模型和文化敏感的NLP框架,为解决低资源语言中的健康虚假信息问题提供了创新思路。尤其是在孟加拉语的应用案例中,研究展示了如何在数据稀缺的情况下,通过负责任的AI设计来提升信息的可信度和可用性,具有重要的社会价值和实践意义。