NeFut Logo NeFut
EN 管理员登录

[AI学术] 人类与LLM共著文本的段落分割:基于变更点检测的创新算法

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#algorithm #AI #Machine Learning

随着大型语言模型(LLMs)的崛起,区分人类撰写与LLM生成的文本变得尤为重要,以确保真实性和社会信任。现有的检测器通常对整段文本进行二元分类,这对人类与LLM共著的文本来说显得不足,因为其目标是定位具体的人类或LLM撰写的段落。

为了解决这一问题,我们提出了一种算法,将文本分割为人类和LLM撰写的部分。我们的关键观察是,该分割任务在概念上与时间序列分析中的经典变更点检测相似。

基于这一类比,我们将变更点检测方法适用于LLM生成文本的检测,开发了一种加权算法和一种广义算法,以适应异质检测得分的变异性,并建立了我们过程的最小最大最优性。

通过实证研究,我们展示了我们的方法在多种现有基准中的强大表现。我们提出的Python实现可在 GitHub 上获取。

博主点评: 本文通过将变更点检测引入人类与LLM共著文本的段落分割,展示了跨领域技术的有效性,提供了新的思路来解决文本真实性问题。

尤其是在当今信息泛滥的时代,这种精细化的检测方法具有重要的实际意义。希望未来能够在更复杂的文本场景中进一步验证和优化该方法。

原文链接: https://arxiv.org/abs/2605.03723

[h] 返回首页