NeFut Logo NeFut
EN 管理员登录

[AI学术] RAGthoven:多阶段管道在SemEval-2026任务中的微弱突破

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Machine Learning #Humor Generation

我们提出了RAGthoven,这是我们在SemEval-2026任务1(MWAHAHA)子任务A(英语、西班牙语和中文的多语种受限幽默生成)中的系统。RAGthoven将创造性文本生成分解为一个多阶段的大型语言模型(LLM)管道,包括规划者(Planner)、最佳作家(Best-of-N Writer)、自我批评的反思者(Reflector)和评判者(Judge)。该系统基于计算幽默理论(良性违反理论和基于脚本的幽默语义理论),并经过十次实验的优化。在我们的最终配置中,我们通过从策划的笑话语料库中进行检索增强生成(RAG),来增强规划者,利用多样的笑话机制进行生成。我们还评估了两种代理变体——ReAct风格的顺序工具调用(Exp09)和自主多分支编排(Exp10),这两者都展示了相同的四个阶段,并配备了确定性的约束审核检查器(ConstraintAudit)。在对保留的12个英语样本进行的实验中,尽管代理变体的工具调用预算显著更高,但我们认为它们的输出并不优于非代理管道。RAGthoven在所有三种语言中与Gemini 2.5 Flash基线共享第一名,在西班牙语中领先基线42个原始Elo分(1182对1140),而在英语(1045对1081)和中文(1045对1053)中,基线在同一统计平局中保持更高的原始评分。这些结果表明,一旦强大的前沿模型在其中,复杂的多阶段提示工程和代理支撑的语言依赖性收益递减现象显著。

博主点评: RAGthoven的多阶段管道展示了幽默生成领域的潜力,尽管在强模型的背景下,复杂的架构似乎并未带来明显的优势。这提示我们在设计生成系统时,需平衡复杂性与实际效果,尤其在多语言环境中。理解幽默的计算理论同样是提升生成质量的关键。

原文链接: https://arxiv.org/abs/2607.13189

[h] 返回首页