NeFut Logo NeFut
EN 管理员登录

[AI学术] 从语言模型嵌入中恢复时间与地理信号

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

我们关注语言模型输出嵌入是否自然携带时间和空间结构。为此提出一种基于投影的极简方法:只需一小批已知时间或位置的种子样本,在嵌入空间上构造一条轴线,然后将待测文本或实体的向量投影到该轴上,投影值越大(或越小)即表示其在相应维度上越靠前。该过程完全黑盒、模型无关,仅使用嵌入本身,无需模型权重、内部激活或额外的探针训练,因而可以直接作用于仅提供 API 接口的现代嵌入模型。

在实验中,我们分别在公开的时间序列语料和地理标注数据集上验证了该方法。结果显示,投影排序能够恢复出清晰的年代顺序和地理分布,例如在新闻语料中,早期文章的投影值显著低于后期文章;在地点描述中,投影值随经纬度呈线性变化。由此证明,语言模型的输出嵌入确实编码了可供检索的时间和空间信息。

该技术的实用价值体现在两个方面:一是为解释性研究提供轻量工具,帮助分析模型内部是否捕获了特定的结构化知识;二是可直接用于下游任务,如时间排序、地理排名或自动标注,无需额外的微调或监督学习。

点评

原文链接: https://arxiv.org/abs/2609.05721

[h] 返回首页