摘要
Capture the Flag (CTF) 竞赛是网络安全领域中最有效的训练场之一,培养了加密学、网络利用和二进制利用等方面的实用技能。如今,大型语言模型(LLMs)能够在最小人类输入的情况下解决越来越多的挑战,这引发了关于公平性、排名有效性以及参与是否仍能提供合理学习价值的紧迫问题。
本文报告了一项关于LLM对现代CTF影响的混合方法研究,结合了已发布基准的综合分析,包括最近的政府评估、三个挑战类别的现场竞赛案例研究、对社区公开讨论AI使用的结构性观察,以及对经验丰富的玩家和组织者的半结构化访谈。我们按类别绘制了当前人机能力边界,显示出加密、网络和二进制利用中的简单和中等挑战现在可以可靠地自动化,而一些较窄的子类别仍然抵抗自动化。
我们发现,社区对于是否允许使用AI的分歧源于一个未公开的先决问题:竞赛的目的是什么。在此背景下,我们提出了一个四个组成部分的保障框架,结合了分级竞赛划分、抗LLM挑战设计、调查性使用的遥测数据,以及草拟的社区行为准则,此外还提供了一个决策工具,将这些保障的组合与竞赛的声明目的联系起来。
这一论点不仅适用于CTF,还适用于任何在网络安全中将证明的结果视为潜在能力证据的场合。
博主点评: 大型语言模型的崛起正在重新定义网络安全领域的竞赛规则,尤其是在CTF这样的技能导向比赛中。如何在促进技术进步与维持公平竞争之间找到平衡,成为了亟待解决的课题。制定合适的框架和规则将是未来CTF发展的关键。