摘要
大型语言模型(LLMs)和智能体如今已成为代码开发中广泛使用的工具,然而数据通常需要发送至第三方云模型。这种做法在使用个人数据的研究中受到治理要求的限制,通常禁止将数据传输到外部服务。可本地部署的开放权重模型提供了一种替代方案,因为敏感数据始终保留在本地环境中。
我们推出了一个开源框架,用于评估由开放权重LLMs驱动的AI智能体在长期人群研究中最常见的瓶颈——数据准备中的有效性。该框架包括:
- 一个经过整理的真实数据集(清洗脚本,准备来自英国队列研究的六轮数据)
- 任务定义,包括类别统一和多波合并等任务
- 自动化例程,用于评估LLM生成的R代码和输出数据。
我们在(消费级)部署范围内对LLMs进行基准测试,评估其在20项数据准备任务中的有效性(创建102个变量)。当前最先进的31-35B参数模型几乎达到我们基准的饱和状态(“平均任务完成率”高达87.9%)。在消费级硬件上运行的开放权重LLMs表现出在治理受限的研究环境中实现AI辅助数据准备的可行路径。我们的框架可在以下网址获取:GitHub - RRBench。
博主点评: 本文提出的开源框架有效解决了在治理限制下进行数据准备的挑战,展示了开放权重LLMs在个人数据处理中的潜力。对于相关领域的研究者来说,这一工具将极大提高数据处理的效率和安全性。