随着代码大型语言模型(LLMs)在现代软件工程中的核心地位日益突出,其固有的不确定性带来了实质性的现实风险,哪怕是微小的错误也可能导致严重的功能、安全或可靠性后果。因此,可靠的自动化需要能够区分自信的、支持良好的预测与随机猜测之间的差异。然而,现有的不确定性估计方法面临着重要的缺口:白盒和灰盒技术往往不适用于闭源模型,而标准的“黑盒”文本指标无法捕捉代码独特的脆弱性,因为句法变化并不总是意味着语义上的差异。
为了解决这一句法-语义的差距,我们提出了Code-MUE,这是一种纯粹的黑盒框架,通过执行基础的语义交互图来测量不确定性。与依赖于表面文本相似性的先前方法不同,Code-MUE将不确定性基于可观察的运行时行为,计算解空间的冯·诺依曼熵以量化全局语义多样性。大规模实证研究显示,在八种最先进的LLM上,Code-MUE与功能正确性之间表现出强烈的负相关性(斯皮尔曼相关系数高达-0.98),显著优于基于词汇和嵌入的基线,同时在实际工作流程中实现了强大的风险检测和选择性预测。
博主点评: Code-MUE的提出填补了现有技术的空白,通过将不确定性与可执行行为相结合,提供了一种更具实用性的评估方法。这种方法不仅提升了对代码LLMs的理解,也为未来的开发和风险管理奠定了基础。