摘要
网络威胁情报(CTI)报告详细描述了现实世界的攻击过程,但其非结构化叙述无法直接用于自动化攻击路径推理。现有的CTI提取方法主要关注指标、实体或TTP标签,而未能对每个攻击步骤的执行条件和结果状态进行建模,因此提取的知识既不支持状态匹配,也无法进行多阶段攻击链的可达性分析。
本论文提出了一种自动化框架,通过将每个攻击步骤建模为包含前置条件、攻击行为和后置条件的攻击单元,提取可达攻击链。一个多阶段管道利用大型语言模型(LLMs)提取攻击行为骨架,恢复其前置条件和后置条件,将其标准化为预定义谓词,并修复破损的依赖关系;最终得到的单元被编译为Datalog风格的规则,以便进行攻击目标可达性推理。
在包含334个经过人工验证的注释步骤的20个CTI报告数据集上,我们的框架在恢复攻击行为方面实现了比代表性CTI提取系统更高的注释步骤覆盖率。此外,通过显式生成前置条件和后置条件,它生成的攻击单元比端到端LLM基准生成的单元更完整且一致。在提取的链上,Datalog推理在20个报告中成功达到指定攻击目标19次,而反向搜索则在生成的规则下得到34条攻击路径。源代码和实验文档已在匿名库中提供。
博主点评: 本文提出的框架通过结合前置条件、攻击行为和后置条件,为网络威胁情报的自动化分析提供了创新思路,显著提高了攻击链的提取质量。未来,这种方法或将推动网络安全领域的智能化发展。