NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示多语言与混合语言滥用检测中的毒性信号条件可靠性

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#algorithm #AI #Machine Learning

在现代的内容审查系统中,外部毒性检测工具的依赖日益增加,但这些工具在处理混合语言、音译、俚语及语言不匹配时表现不佳。我们研究了印度多语言和混合语言短文本中毒性信号的条件可靠性:英语毒性、印度语言的滥用及基于规则的严重性提示可以提供有用的证据,但仅在某些语言和滥用严重性上下文中有效。为此,我们提出了ToxGate,一种信任融合头,它在将每个辅助信号添加到预测状态之前,基于编码器表示对其进行条件处理。在三个短文本滥用数据集、四种变换器编码器和每个设置的五个随机种子上,ToxGate在12个领域内设置中的10个和8个转移设置中的7个上超越了匹配的普通编码器。最大的、最具可解释性的提升出现在高风险的审查片段中,包括明确的侮辱性言辞、暴力威胁和跨数据集转移。更广泛的教训是,内容审查系统应将外部毒性工具和先验视为条件证据,而非固定特征或真实标准,在重点消融实验中,特定来源的门控在转移、严重滥用片段和高风险分流中表现出最强的效果。

博主点评: ToxGate的提出为毒性检测提供了新的思路,尤其是在多语言环境下,强调了条件可靠性的重要性。这种方法不仅提升了检测准确性,也为内容审查系统的未来发展指明了方向。其在高风险场景中的表现尤其令人鼓舞,值得进一步研究与应用。

原文链接: https://arxiv.org/abs/2607.15861

[h] 返回首页