本文聚焦临床试验中的人机交互(HAII),提出一种多维分类框架。框架将交互划分为四个维度:AI 任务、人与 AI 的关系、交互配置以及参与交互的人群类别。首先给出 HAII 的定义,并回顾已有的分类体系,指出它们在临床试验记录中的局限性。随后介绍本研究的多维框架,强调四个维度的组合能够完整描述任何临床试验中的 AI 介入方式。
研究抽取了先前数据集中的 15 项临床试验作为样本。每项试验由两位人工评审独立进行分类,同时使用六个大型语言模型(LLM)分类器进行自动标注。比较结果显示,LLM 在多数情形下能够快速给出一致的标签,但在记录不完整或描述模糊时仍需人工判断以确保准确性。
该框架的核心贡献在于提供了一套统一的语言,帮助研究者在不同试验之间进行系统的识别、比较和综合。通过明确人类在 AI 干预中的角色,框架有望提升 AI 相关临床试验的可重复性和透明度。
点评