AI 文本检测器正被广泛用于学术环境,但它们的输出到底是反映 AI 作者身份,还是仅仅捕捉到更为正式的学术英语特征,仍未可知。已有研究指出,非母语英语写作的误报率(FPR)偏高,但这些研究往往在比较不同人群时混入了主题、学科和写作风格的差异。
专业编辑服务提供了一个理想的实验场景:同一篇稿件在保持作者、内容不变的前提下,通过编辑改写语言形式。我们收集了 2018 至 2025 年期间 135,389 对稿件(原始非母语稿件及其经母语编辑后的版本),并对 13 种主流 AI 文本检测器进行测试,观察编辑对检测结果的影响。
结果显示,13 种检测器对人类文本的误报率差异极大,最低为 0.0%,最高甚至达到 100.0%。更有趣的是,同一篇稿件的编辑在不同检测器上会产生相反的效果:有的检测器的 AI 分数随编辑提升,有的则下降。分数变化幅度与编辑程度呈正相关,即编辑越多,分数波动越大。
这些发现表明,专业编辑的写作风格本身是 AI 检测器输出的关键混淆变量,而不是简单地将文本来源与语言风格完全分离。这对学术界的公平性和检测可靠性提出了警示。
博主点评:本文通过大规模、可控的编辑前后对照实验,直观揭示了写作风格对 AI 检测的巨大影响。研究提醒我们在使用检测工具时应慎重,尤其在评估非母语作者时,更应考虑编辑服务带来的潜在偏差。