安全团队和研究者在选择威胁报告的知识图谱抽取工具时,往往依据已公布的 triple‑F1 分数。然而,这些分数高度依赖预测三元组与金标准的匹配方式。我们仅在十二个系统中成功复现了五个系统的匹配规则。对十个系统在共享文档上的输出,使用八种匹配协议重新评分,导致四十五对排序中有十一对顺序被颠倒;同一固定预测集合的 F1 在 0.16‑0.70 之间波动。 在 GRID 的 378 条外部校准集上,词汇、嵌入或蕴含等机械匹配器的最高一致率不超过 71%,而大型语言模型评审可达 86%。 为了分离组件影响与匹配器奖励,我们构建了 CTIForge,其确定性验证层可在抽取保持字节相同的前提下切换。七种部署配置的实验表明,验证层提升了四个在线骨干网的精度,却降低了三个离线骨干网的精度。由于骨干网、解码方式和后端提示相互关联,这一现象更像是描述性的划分,而非单独的服务效应。与此同时,显式争议实体类型的操作约增加了 2.8 倍,这与手写规则对提取器约定的编码一致。 我们已公开完整流水线、协议套件以及每条三元组的审计记录。 点评