NeFut Logo NeFut
EN 管理员登录

[AI学术] 句子拆分器:揭示自监督学习中的潜在事实结构

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #NLP

摘要

本文介绍了一种名为句子拆分器的自监督框架,该框架基于 T5 编码器-解码器架构,旨在揭示自然语言句子的潜在事实结构。所提出的方法通过将句子拆分形式化为离散分割问题,识别描述前缀(头)与其事实补全(尾)之间的语义边界。对于长度为 $N$ 的句子,存在 $N$ 个可能的分割点,但只有一个能够恢复预期的头-尾结构。

模型通过概率序列生成学习恢复事实补全,而不是显式地搜索所有候选边界。为了消除手动标注的需求,符号头-尾对首先被转化为自然语言模板,以为训练句子拆分器提供监督。经过训练的拆分器随后应用于原始文本,以提取对齐的前缀-尾对,这些对接着用于训练生成模型,通过轻量级引导过程提出额外的合理补全。

这种统一的管道提供了一种可扩展且结构感知的方法,用于构建自监督训练数据,同时桥接符号知识与自然语言。针对结构化和自然发生文本的实验表明,所提拆分器超越合成模板具有良好的泛化能力,并且所产生的结构感知监督在知识图谱补全和常识问答等下游任务上的表现一致改善,突显了恢复潜在事实结构在知识中心自然语言处理中的有效性。

博主点评: 句子拆分器通过创新的自监督学习方法,成功结合了符号知识与自然语言,展示了其在知识图谱和问答系统中的应用潜力。这一方法不仅提高了模型的泛化能力,还为未来的自然语言处理研究提供了新的方向,尤其是在处理复杂的语义结构时。其轻量级的引导过程也为训练数据的构建带来了便利,值得深入探索。

原文链接: https://arxiv.org/abs/2607.19845

[h] 返回首页