Vibe Patenting 是一个端到端的专利撰写测试平台,用于评估 AI 代理在专业专利工作流中的表现。
评估流程中,单独调用的 LLM 裁判读取生成的专利草稿,提供结构化的反馈,代理据此进行迭代修订。
实验在多个发明和不同撰写代理配置下进行。结果显示,裁判引导的迭代能够持续提升裁判评估的质量,而未受裁判指导的迭代很快出现饱和。
关键发现包括:裁判反馈使推理能力较弱的代理的质量接近使用高推理成本模型的代理;更强大的模型和更多的推理步骤普遍提升裁判评估的撰写质量;加入领域特定的工作流进一步带来增益。
我们将裁判的评分与专业专利律师的独立评估进行对比,发现两者在不同度量上存在一定的一致性,但也表现出强烈的度量依赖性和系统性的校准差异。
这些结果表明,LLM 裁判在复杂专业工作流中可以作为有价值的评估和优化信号,但其效用受限于度量选择和校准问题。
点评