摘要
欧洲专利局(EPO)在2025年报告了创纪录的申请数量,而2026年EPO指导方针要求申请人对LLM辅助内容在第83条和第42条下负责,这给疑似为AI生成的专利文本带来了筛选压力。
挑战
此过程面临两个主要约束。首先,现实的申请环境通常仅配备约8GB VRAM的消费级GPU,而非数据中心级的评分堆栈。其次,欧洲专利公约第84条要求权利要求必须清晰简明,这将人类起草推向了与LLM相同的低困惑度、低爆发性流形。
检测性能
我们在500个获批的EPO H04电信专利与500个LLM生成的对应文本上基准测试了三种开源零-shot检测器,使用五种提示策略,均在消费硬件环境下进行。结果显示,在权利要求级别,所有检测器的假阳性率均超过60%:Binoculars 78.3%,Fast-DetectGPT 61.3%,DetectGPT 80.5%。这一失败在Qwen2.5-3B-Instruct再生成、LoRA调整的Pythia-2.8B评分头、跨IPC在A61K、C07D和F03D上的复制(平均假阳性率84.6%)以及H100再评估中持续存在,结合已发布的Falcon-7B和GPT-J-6B头,表明问题是结构性而非替代模型能力。
复杂性回归
通过七个特征的语言复杂性逻辑回归,我们在28.1%的假阳性率下达到了74.0%的准确率,相较于仅使用困惑度的基线在可比操作点上提升了13个百分点,而不使用推理时的似然值,并且在相同的硬件预算内实现。
博主点评: 该研究揭示了专利法与AI生成内容之间的复杂关系,尤其是在技术限制和法律要求下,如何有效识别AI生成文本仍然是一个严峻挑战,值得进一步探索更有效的检测方法。