NeFut Logo NeFut
EN 管理员登录

[AI学术] 无云计算的智能编码:评估开放权重大型语言模型在长期数据准备任务中的表现

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Open Source

摘要

大型语言模型(LLMs)和智能体如今已成为代码开发中广泛使用的工具,然而数据通常需要发送至第三方云模型。这种做法在使用个人数据的研究中受到治理要求的限制,通常禁止将数据传输到外部服务。可本地部署的开放权重模型提供了一种替代方案,因为敏感数据始终保留在本地环境中。

我们推出了一个开源框架,用于评估由开放权重LLMs驱动的AI智能体在长期人群研究中最常见的瓶颈——数据准备中的有效性。该框架包括:

我们在(消费级)部署范围内对LLMs进行基准测试,评估其在20项数据准备任务中的有效性(创建102个变量)。当前最先进的31-35B参数模型几乎达到我们基准的饱和状态(“平均任务完成率”高达87.9%)。在消费级硬件上运行的开放权重LLMs表现出在治理受限的研究环境中实现AI辅助数据准备的可行路径。我们的框架可在以下网址获取:GitHub - RRBench

博主点评: 本文提出的开源框架有效解决了在治理限制下进行数据准备的挑战,展示了开放权重LLMs在个人数据处理中的潜力。对于相关领域的研究者来说,这一工具将极大提高数据处理的效率和安全性。

原文链接: https://arxiv.org/abs/2607.21482

[h] 返回首页