在本研究中,作者探讨了大型语言模型(LLMs)在软件开发中的同质化现象,特别是AI编码助手可能导致开发者创造的软件工件趋于一致。研究基于2019年至2026年中期的Kaggle比赛提交数据,首先记录了广泛的趋同现象,尤其是随机种子值42的使用,这反映了编程文化中的长期惯例。
研究通过两个层面的聚合和抽象来分析代码同质化:在提交层面,测量了比赛中提交代码的平均对称相似度;在比赛层面,考察了提交代码的概念跨度。为此,采用了TF-IDF表示法来捕捉表面语法,以及Voyage 3代码嵌入用于捕捉代码意图和语义。
研究结果表明,在个体和集体层面上都存在显著的语法同质化:个体提交在字面语法和代码结构上变得更加相似,而语法变化的潜在维度则缩小。相反,语义同质化的证据较少,个体和集体的平均语义距离基本保持平稳,比赛层面的语义方法的潜在维度跨度保持稳定,甚至有扩展的迹象。这些发现表明,AI编码助手正在标准化实现细节,但尚未产生编码者在方法和问题解决策略上同质化的证据。
博主点评: 本文揭示了大型语言模型在代码生成中的潜在影响,强调了语法层面的同质化问题,但同时也指出语义层面的多样性依然存在。这为开发者在使用AI工具时提供了重要的反思,提醒我们关注代码的创新与多样性。