MGAL 是首个面向多语言、粒度与位置感知的长上下文基准。它基于联合国报告构建,覆盖六种官方语言,文本长度在 8K‑128K token 之间。数据在四个语言粒度层级(词、句、段、文)上进行标注,并在文档层面和段落层面进一步按出现位置(开头‑中部‑结尾)索引,便于系统化评估模型在不同粒度和位置的理解能力。
实验结果显示,现有 LLM 在词级任务上表现良好,但在句、段、文等更粗粒度上显著下降;闭源模型在资源较少的语言上仍保持明显优势。
研究还发现两类新挑战:局部语义拥挤时,相邻句子主题和实体高度相似,模型倾向于依据表面线索(如 "however" 或重复实体)而非句子的真实语篇角色(背景、结果等)作出判断;流畅性‑一致性差距表现为生成文本虽阅读流畅,却偏离原始事实。
这些现象与既往工作一致,模型仍依赖最近的证据,并在不确定时重复选项。
博主点评:MGAL 为长上下文多语言评测提供了细粒度视角,揭示了当前 LLM 在跨语言、跨层级理解上的短板,为后续模型改进指明了方向。