我们介绍了LLM-INSTRUCT,这是在2026年ArgMining的UZH共享任务中获胜的系统,专注于联合国和联合国教科文组织决议的段落级论证挖掘。该任务要求进行段落类型分类、预测141个官方标签的子集,并在严格的JSON架构设置下进行有向关系预测,使用的仅是最大8B参数的开放权重模型。
我们将该任务框架化为受限结构化预测。系统首先通过元数据感知的密集检索缩小候选标签空间,然后应用具有每维度上限的受限解码,仅将不确定的情况升级到三方讨论分支,最后验证输出架构。在官方排行榜上,LLM-INSTRUCT整体排名第一,F1得分第一,LLM作为评审的得分第五。在开发过程中,我们的配置搜索进一步将任务1b的Micro-F1从35.83%提高到40.08%,同时保持任务2的内部得分在4.421。主要经验教训很简单:在生成之前减少决策空间可以提高准确性和提交的稳健性。
我们的代码和支持脚本已公开发布,地址为:LLM-INSTRUCT GitHub。
博主点评: LLM-INSTRUCT通过元数据感知的检索和受限解码技术,展现了在段落级论证挖掘的高效性与准确性,为相关领域的研究提供了重要的参考和借鉴。其方法论值得其他任务借鉴,尤其是在处理复杂结构化数据时。