VakyArth 是首个面向印地语系语言的语用基准,覆盖 Hindi、Punjabi、Tamil、Malayalam 四种语言。基准聚焦五类语用现象:指示(deixis)、言语行为(speech acts)、暗示(implicature)、社会语用(social pragmatics)以及篇章连贯(coherence),通过多项选择题、自然语言推理(NLI)和翻译任务进行诊断,所有题目均由母语者撰写。\ \ 在不同家族、不同规模的多语言大模型上实验发现,模型普遍在依赖印地语系语言和文化约定的语用意义上表现失误。具体表现为:\
- 所有模型‑语言组合中,多项选择题的准确率始终高于 NLI 的准确率;\
- 翻译任务的表现并不能可靠反映模型的语用理解能力;\
- 印欧语系(Indo‑Aryan)语言相较于达罗毗荼语系(Dravidian)语言在翻译上有明显优势。\ \ 进一步分析表明,自动翻译评价指标(如 BLEU、ROUGE)往往忽视流畅但语用不忠实的输出,尤其在暗示和指示现象上误判为高质量。\ \ 点评:VakyArth 揭示了当前多语言大模型在印地语系语言的语用推理方面的系统性短板,提示未来需要在数据、模型结构以及评估方法上加入更丰富的文化与语境信息。