NeFut Logo NeFut
EN 管理员登录

[AI学术] 文化语境中的能力:大型语言模型在芬兰通过图灵测试

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

我们在芬兰使用芬兰语开展了一场图灵测试,评估 ChatGPT 5.2 在非英语文化语境中的表现。由于训练数据中对不同语言和文化的覆盖不均,我们原本预期模型在芬兰语环境下的表现会逊色于此前在美国英语环境中的结果。为提升比较实验的构建效度,我们引入了模型生成的角色提示(role prompting)技术,使得实验者能够在相同的对话框架下分别与人类和模型交互。实验结果出乎意料:模型成功通过了芬兰语图灵测试。参与者主要依赖口语化的芬兰语特征来判断作者身份,这成为主要的误判来源。我们将图灵测试重新定义为一种比较方法,用于检验 AI 是否能够在特定社会世界中表现出可信的成员身份,而非单纯的智能测评。该方法同时捕捉模型能力、提示身份、参与者的内部文化熟悉度以及 AI 素养,因而可作为跨领域探测人机边界的有力工具。

点评

原文链接: https://arxiv.org/abs/2609.18394

[h] 返回首页