恶意软件分析要求快速解读复杂的引爆报告,涉及文件系统、网络和进程行为。尽管大型语言模型(LLMs)在技术文物解读方面展现出令人印象深刻的能力,但封闭权重模型的复杂性和不断攀升的API成本促使探索开放权重的替代方案。
然而,许多开放权重模型体积庞大,需要显著的计算资源,并且产生的托管成本也使其在资源受限的环境中难以实现。本文探讨了小型语言模型(SLMs)的协同组合是否能够在恶意软件引爆报告的结构化问题上匹敌或超越单一LLM的表现。
我们通过在Meta的CyberSecEval恶意软件分析基准上测试了11个开放权重SLMs、3个网络安全预训练模型和6个前沿LLMs建立了基线。随后,我们设计并评估了四种协同架构:(i) 一个多代理管道将分析分解为结构化的证据收集和推理阶段,(ii) 一个对抗辩论框架,其中两个代理相互批评彼此的推理,(iii) 一个分层咨询系统,将通用SLM与网络安全专业模型配对,以及(iv) 一个将基于证据的管道与对抗辩论推理相结合的混合架构。
混合系统(Qwen3-4B与Foundation-Sec-8B)达到了35.30%的整体准确率,超越了最强的网络安全专业基线(22.54%)和最强的无依据前沿基线(34.77%);在相同证据管道下,基于证据的Gemini保持了38.22%的最佳配置。这些发现表明,基于证据的协同可以显著提高小型模型在支持恶意软件引爆报告解读中的表现。
博主点评: 该研究展示了小型语言模型在恶意软件分析中通过协同工作能够超越大型模型的潜力,尤其是在资源受限的环境中,提供了更具成本效益的解决方案。通过多种架构的设计,研究者们有效地利用了模型之间的互补性,推动了网络安全领域的技术发展。