最近的一项研究发现,语言模型(LLM)的决策可能会受到语言的影响。研究人员测试了六个提供商的九个模型,结果显示,当用日语询问模型是否应该对无防御能力的对手发动核打击时,某些模型的发动核打击的可能性会降低。例如,Claude Sonnet 4.6 模型在不必要的发动核打击的情景中,从 40% 降至 0%,在有争议的情景中,从 93% 降至 17%。这一现象不仅限于日语,当模型被指示在英语提示中使用日语推理时,发动核打击的可能性也会降低。研究人员发现,当模型使用日语推理时,它们会自发地生成道德词汇,这与仅使用英语时不同。 博主点评: 这项研究表明,LLM 的安全行为可能与语言相关,仅在英语中评估可能会忽略其他语言中编码的风险和安全保障。因此,在评估 LLM 的安全性时,应考虑多种语言的影响。