在大规模文本分析任务中,预训练语言模型通常用于嵌入文本语料以供后续分析。然而,这些模型在捕捉特定领域的语义方面可能存在困难,适应这些模型通常需要大量标注数据和技术专长来实现训练流程。最近的方法展示了如何通过文档投影中的视觉交互捕捉人类反馈作为模型调优的训练信号。
然而,这些方法依赖于文档级反馈,要求用户打开并评估单独文档以提供有效反馈。为了解决这个问题,我们提出了KeySI,一个通过基于关键词的概念规范实现特征级反馈的交互框架。用户通过将提取的关键词组织成代表概念的组来指定反馈,而KeySI将其转化为文档级监督以进行后续调优。
通过将关键词作为主要交互媒介,KeySI减少了手动文档检查和标注的需求,从而降低了适应嵌入模型的门槛。我们展示了一个原型实现,该实现从语料库中策划代表性关键词,利用降维技术可视化关键词和文档嵌入,允许用户交互式地指定关键词组,并通过系统反馈支持迭代优化。
我们通过用户研究、使用场景和定量实验评估了KeySI,结果显示其在捕捉用户意图和改善嵌入对齐方面的有效性。
博主点评: KeySI通过简化用户与文本嵌入模型的交互过程,降低了领域适应的难度。这种基于关键词的反馈机制不仅提高了用户的参与度,还显著提升了模型的调优效率,展示了人机交互在自然语言处理中的重要性。