NeFut Logo NeFut
EN 管理员登录

[AI学术] CESBench:面向物联网设备密码工程安全的大语言模型基准

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#AI #LLM #Cryptographic

物联网(IoT)设备在面对物理接触时,仅靠安全算法不足以防御攻击者直接针对实现的攻击,这类缺陷在部署后难以修复。近年来,大语言模型(LLM)被用于构建和分析这些实现,但现有的密码学或通用网络安全基准并未覆盖密码工程的全貌。为此,本文推出 CESBench,收录了 380 条由专家撰写的题目,覆盖密码工程安全的六个子领域:侧信道、故障注入、实现细节、防护措施、评估以及系统集成。题目分为四类任务,以考察不同能力:209 道选择题用于记忆检验,67 道判断题要求给出安全结论并说明理由,63 道情境题需要进行工程诊断,41 道代码任务通过 572 条测试用例自动评分。为验证基准,作者让 11 种开源和商业 LLM 完成全部题目。选择题和代码题采用自动评分,判断题和情境题则由另一 LLM 充当评审,并与不同模型族的第二位评审以及人工复核结果对比。综合得分在 54.4% 到 83.6% 之间。最高单项得分分别为:选择题 98.6%,代码 95.1%,情境诊断 88.4%,判断题仅 58.8%。整体来看,88.5% 的安全结论是正确的,但其论证仅获得 53.4% 的评分。选择题已接近上限,代码任务大多被解决,而给出安全结论的论证仍是最薄弱的环节。基准、提示词以及每题的结果均已公开。

点评

原文链接: https://arxiv.org/abs/2609.21344

[h] 返回首页