NeFut Logo NeFut
EN 管理员登录

[AI学术] ParBench:可靠评估大语言模型并行代码翻译的基准测试

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#algorithm #Machine Learning #Open Source

概述

现代计算密集型软件必须在不断变化的加速器、编程API、编译器栈和可移植性层(如CUDA、OpenMP、OpenCL以及OpenMP目标卸载)之间迁移。随着大语言模型(LLM)和自主编码代理的提出,如何可靠地测量它们是否保留了低级并行语义变得尤为重要,包括线程索引、同步、内存管理、主机-设备协调和特定API的执行结构。

我们提出了ParBench,一个以内核为中心的基准测试框架,用于在可执行和可重现的条件下评估基于LLM的并行API翻译。ParBench通过声明性基准规范固定了周围的构建、运行和验证基础设施,并要求模型仅翻译计算内核。该框架借鉴了多个开源高性能计算(HPC)套件,涵盖了CUDA、OpenMP、OpenCL和OpenMP目标卸载之间的代表性交叉API翻译方向。

为了测试成功是否反映了稳健的翻译而非表面形式的记忆,ParBench还包括AST驱动的、意图行为保留的、基线验证的源代码增强。对最先进的开源和专有LLM的评估显示,在可靠的并行代码翻译方面仍存在持续的障碍,包括方向不对称、多文件协调、不完全的API适配,以及对源级扰动的鲁棒性不均。

代码可在 GitHub 获取。

博主点评: ParBench的提出填补了当前大语言模型在并行代码翻译评估中的空白,强调了低级语义保留的重要性。其基于AST的增强方法展示了对翻译准确性的深入关注,未来的研究可以在此基础上进一步提升模型的鲁棒性与适应性。

原文链接: https://arxiv.org/abs/2607.22588

[h] 返回首页