NeFut Logo NeFut
EN 管理员登录

[AI学术] 系统评估:LoRA微调代码代理的轨迹数据管理

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #optimization

摘要

监督微调(SFT)开放权重大语言模型(LLMs)基于专家代理轨迹,已成为构建强大代码代理的一种重要方法,而无需依赖专有模型。一个中心但尚未深入探讨的问题是轨迹的质量和数量如何共同影响模型性能。我们对LoRA微调Qwen2.5-Coder-7B-Instruct在SWE-轨迹数据集(67,074个轨迹,其中32,161个已解决)上进行系统的实证研究。

我们提出了一个双轴质量评分框架——效率和风格,并通过16个控制实验进行评估,这些实验涵盖了策略、规模和消融分析。由于7B规模的模型在SWE基准的解决率接近零,我们采用在保留轨迹上的交叉熵(CE)损失作为主要指标,并通过首次动作生成进行验证:CE损失与ROUGE-L完全排名相关(Spearman $\rho$ = -1.00),有限样本证据支持但并未确立这一代理关系。

我们的结果揭示了尺度依赖性的质量-数量权衡:在小规模下,数据集翻倍(从500到1,000)可使CE损失减少约12.7%,而TopQ-Random间隙保持在0.10;在2,000个轨迹时,这一间隙扩大到3.6%(p = 0.016)。消融分析进一步确定错误重试率是主导子维度,其表现与完整复合模型相当($\Delta$)。

博主点评: 本研究深入探讨了轨迹数据的质量与数量对代码代理模型性能的影响,提出的评分框架为未来的微调策略提供了重要参考。通过系统的实验设计,结果不仅揭示了数据集规模的影响,还为优化数据处理提供了实证依据,具有重要的理论与实践意义。

原文链接: https://arxiv.org/abs/2607.17205

[h] 返回首页