NeFut Logo NeFut
EN 管理员登录

[AI学术] 2026年SemEval任务11:通过合成训练与多目标优化解构形式逻辑与内容

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#algorithm #AI #Machine Learning

在大型语言模型(LLMs)在许多通用自然语言处理任务中表现出色的同时,它们的形式推理能力常常受到内容效应的影响,显示出对现实世界可行性的可测量偏见。本文介绍了我们在2026年SemEval任务11中的系统,该任务评估模型在12种语言中解构形式逻辑与内容的能力,涵盖带有和不带有干扰前提的情况。

为了解决这一挑战,我们使用了经过微调的mDeBERTa-v3网络,针对一个合成的、基于规则的三段论数据集进行训练,以避免LLM增强数据的语义噪声。为了明确地将可行性与逻辑结构解耦,我们的训练管道采用了多目标损失函数,结合了自适应群体分布鲁棒优化(DRO)、调度的可微偏差惩罚以及KL散度一致性正则化。

在子任务1(英语)、子任务2(噪声英语)和子任务3(多语言)中,我们的系统取得了第一名的排名和完美的排名分数(100.0),偏差为0.00%,准确率为100.0%。在高度复杂的子任务4(噪声多语言)中,系统获得了第六名,准确率和F1分数为89.06%,偏差为2.89%,排名分数为37.78。我们的数据集生成引擎和代码库公开可用,以促进未来在稳健逻辑推理方面的工作。

博主点评: 本文通过细致的多目标优化策略,成功将形式逻辑与内容分离,展现出LLM在推理任务中的潜力与挑战。其方法论值得在更广泛的NLP领域内进一步探讨与应用。

原文链接: https://arxiv.org/abs/2607.14349

[h] 返回首页