法律研究是律师日常工作中最耗时的环节之一,需要定位控制性法规、确认其有效性、调和法条与判例,并给出有依据的结论。语言模型代理天然适合这种检索密集型流程,部分自动化即可带来显著价值。但价值的前提是可靠性:一次遗漏、过时引用或错误结论都会让答案失效。
我们推出 Legal Research Bench(LRB),收录 413 条由专家撰写的美国法律研究开放式问题,每题配有金标准答案、支撑性权威文献以及二元评分标准。评测在一个集成了网页搜索、案例检索、页面解析和检索工具的框架中,对 13 种前沿模型进行测试。
评分采用全通过(all‑pass)方式:只有当模型的回答满足所有必需条件且引用的权威文献经核实后才算正确。我们进一步用资深律师对 LLM 判官进行校准,确保基准分数能够反映律师的判断。
实验结果显示,现有模型仍远未可靠。表现最好的 Claude Opus 4.8 仅在 42.9% 的问题上全额正确。不同法律领域的全通过率差异显著,涉及冲突权威调和的问题表现尤为低下。模型的对话轮数、工具调用次数以及推理成本并未显著提升准确率。
点评