摘要
实际的代码仓库问题通常包含视觉证据,如截图、错误对话框、渲染的用户界面状态和日志,但现有的仓库级问题定位评估主要是文本任务。现有的多模态软件工程基准评估端到端的修复过程,将定位与补丁合成纠缠在一起,模糊了视觉输入是否有帮助、造成了负面影响或被忽视。我们引入了 MM-IssueLoc,这是一个受控基准和评估协议,用于具有视觉证据的仓库级定位。
MM-IssueLoc 包含 652 个问题-PR 实例,覆盖 23 种语言,并对 7 种图像类别和 4 种相关性水平进行了注释。它提供了文件级和函数级的金标准标签,配对的仅文本和带图像的评估,以及基于视觉内容的诊断,将图像转换为结构化的文本证据。我们评估了基于 LLM 和检索的系统,包括 MM-IssueLoc-VL-Emb,作为一个受控的多模态检索器。
结果表明,现有系统在多模态仓库定位方面仍然远未可靠:最强的代理达到 38.96 的文件 Acc@5 和 22.45 的函数 Acc@10,而最强的检索器达到 33.86 的函数 Acc@10。跨基准比较显示,在文本主导的 SWE 基准上获得的高定位分数并不能有效转移到多模态问题定位。MM-IssueLoc 将视觉证据转化为明确的评估变量,使未来的工作能够测试系统是否通过使用视觉证据进行定位而改善,而不是仅依赖文本线索或后续的补丁生成效果。
博主点评: MM-IssueLoc 的引入为多模态问题定位提供了一个新的评估框架,强调了视觉信息在软件工程中的重要性。通过系统的实验和比较,研究者可以更好地理解视觉证据如何影响问题定位的准确性和效率。未来的研究可以基于此基准进一步探索视觉信息的潜力。