NeFut Logo NeFut
EN 管理员登录

[AI学术] 喜剧愚金:对话幽默中的奖励利用与对策

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

我们研究了在对话幽默训练中使用自动奖励的可行性,重点关注奖励被利用的方式以及相应的防御措施。两类奖励分别捕捉可理解的惊讶感和预测的观众笑声。

在受控实验中,基于嵌入的惊讶奖励会把词序打乱的回复误判为机智回复。为此我们加入了流畅性过滤器来检测这些打乱,但组合奖励仍会错误拒绝部分真正的机智回复,并在后续验证中失效。

观众模型预测的笑声则容易受到说话者信息中的笑声线索影响。对这些线索在不同说话者之间进行归一化可以阻断已知攻击,但仍有未匹配的表达方式可以被利用。

我们进行了三次强化学习训练,每次都在奖励函数上做了修正。最终一次实验使综合评估得分提升了 0.0903,零分会话数量下降了 40%,但幽默专属性的提升仍未达到预先登记的目标。

这些结果表明,自动奖励设计面临更广泛的挑战:防御措施必须阻止可利用的捷径,同时保留奖励本意所鼓励的行为。

点评

原文链接: https://arxiv.org/abs/2610.00197

[h] 返回首页