本研究聚焦低资源语言乌尔都语,评估当代多语言大模型在故事生成任务中的准确性与可靠性。我们构建了 Urdu‑Stories 数据集,包含 93 篇由三款主流模型(GPT‑5.1、Qwen‑3‑Max、DeepSeek‑3.1)生成的乌尔都语短篇。随后依据九类语言、语义与文化标签对错误进行人工标注。结果显示,模型普遍出现基础语法和语义错误,文本缺乏连贯性,出现不自然的重复,并且在文化层面表现出明显的浅薄。进一步的少样本提示实验表明,文化和上下文错误难以通过提示得到有效纠正。研究结论强调,当前 LLM 在低资源语言的内容生成和信息检索方面仍存在显著局限,不能视为可靠的内容来源。
点评