在本研究中,我们使用线性控制系统课程的练习题和参考解答,构建了一个包含 360 条系统‑用户‑助理对话的监督微调数据集。我们对 Qwen2.5-3B-Instruct 和 Qwen2.5-7B-Instruct 应用了 LoRA,分别在秩 r=4、8、16 的设置下进行微调。数据划分、推理配置和评估流程保持一致,以便公平比较基线模型和微调模型的表现。
评估采用 ROUGE、BERTScore 以及结构化输出特征,衡量生成答案与参考答案的相似度以及 “Solution‑Method‑Teaching Points” 格式的稳定性。实验结果显示,LoRA 在两种模型规模上均提升了相似度和结构化输出的稳定性。具体而言,7B‑r16 在当前测试集上取得最高的 ROUGE‑L 为 0.4093,BERTScore‑F1 为 0.8643;而 r=8 在性能与参数效率之间提供了更好的平衡。
我们进一步使用自助抽样(bootstrap)对 ROUGE‑L 的提升进行置信区间估计。3B‑r16 的增益为 0.0764 [0.0613, 0.0915],7B‑r16 的增益为 0.0874 [0.0687, 0.1042],两者的区间均不包含零,表明在当前测试集上文本相似度的提升是稳健的。
这些结果表明,LoRA 能够使开源指令微调模型更好地对齐课程参考答案的语言风格和教学组织结构。但需要注意的是,所使用的指标主要捕捉文本相似度和格式一致性,未能直接评估领域推理或数学正确性,这仍需专家评审和任务特定的评分标准。
点评