NeFut Logo NeFut
EN 管理员登录

[AI学术] ISA-Bench:跨指令集架构的计算推理基准

发布于:2026-09-23 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #LLM

大型语言模型代码生成基准主要评估 Python、Java 等资源丰富的语言,模型受益于海量训练数据。但它们对陌生计算模型的推理能力提供的证据很少,例如仅用一条减法指令实现算术、在通信节点上协同并行程序、或将逻辑门连成电路。为此我们推出 ISA‑Bench——一个包含受限指令集的编程游戏基准。每个游戏配备完整执行栈:解析器、虚拟机和验证器,支持自动评估并提供结构化反馈,以便迭代改进。实验表明,推理模型的平均解题率高于专注代码的模型和通用模型,但不熟悉的语法仍是主要失误来源。引入迭代反馈后模型解题数提升,提升幅度在不同指令集上差异显著。我们进一步提出推理‑执行差距(REG)分析,揭示模型在找到可行计算策略与将其正确实现为目标 ISA 程序之间的常见脱节。代码已开源。

点评:ISA‑Bench 为评估模型在非主流指令集上的推理与实现能力提供了可复现平台,揭示了语法适应和程序合成之间的关键瓶颈。

原文链接: https://arxiv.org/abs/2609.22878

[h] 返回首页