NeFut Logo NeFut
EN 管理员登录

[AI学术] 识别却未生成:面向特定文化亲属术语的生成基准

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

当前研究多使用多项选择题评估大型语言模型(LLM)在多语言亲属关系理解上的表现,实际上把任务当作识别问题。本文改为让五个开源权重模型在印地语、泰米尔语和韩语三种非西方语言中,针对两类交际任务生成亲属称谓,并与一个提供四个候选项的选择基线进行对比。\ \ 在相同的关系‑语言单元上,GPT‑OSS120B 在 75 个有效单元中有 90.67% 能选出正确答案,但在对应的生成尝试中仅有 36.00% 能产生被接受的称谓;Llama‑3.370B 同样表现为 77.92% 对比 24.24%。由于四选项条件直接展示候选词且不要求脚本输出,这一差距被解释为评估形式差异,而非模型词汇知识缺失的直接证据。\ \ 在明确指明第三语言(L3)提示的情况下,各模型的准确率差异显著:GLM‑5.1 达到 72.29%,而 Llama‑3.370B 仅为 24.24%。父系血缘优势呈现语言特异性:在印地语中优势明显,韩语中则弱甚至逆转;泰米尔语的共享词对提供了测量变异的对照。\ \ 这些结果表明,即使关系已明确说明,生成特定文化亲属称谓仍然困难,因而需要在多项选择之外,引入生成式评估来更全面衡量模型的亲属知识。\ \ 点评

原文链接: https://arxiv.org/abs/2609.26942

[h] 返回首页