在机器翻译(MT)领域,文化负载翻译面临独特的挑战,因为意义深深嵌入了超越表面语言形式的社会文化背景。尽管大型语言模型(LLMs)使得MT系统在许多场景中达到了类人质量,但它们处理文化负载表达的能力仍然未被充分探讨。本研究系统性地调查了基于LLM的MT系统所面临的文化负载翻译挑战。
我们构建了一个中日双语数据集,源自具有文化代表性的语料《红楼梦》,包含500个跨多种文化类别的段落。通过全面的评估协议,我们揭示了三个主要挑战:
- 任务挑战:前沿的LLM在处理文化负载内容时表现出显著的性能差距。
- 人类评估挑战:评估者的背景导致翻译判断上存在显著分歧。
- 自动评估挑战:广泛使用的评估指标无法可靠地评估该任务的翻译质量。
这些发现可能为计算科学和语言学中的文化导向翻译研究提供宝贵的见解。
博主点评: 本文深入探讨了文化负载翻译的复杂性,强调了LLM在此领域的局限性,促使我们反思机器翻译技术在处理文化特征方面的不足。未来研究应更注重文化语境的理解,以提升翻译质量。