NeFut Logo NeFut
EN 管理员登录

[AI学术] Benchy:面向任务导向 AI 基准的通用语言

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #Open Source

Benchy 是一种面向 AI 程序基准的语义语言与执行引擎。基准由 程序、评分函数、数据集 三要素完整描述,记作 $$B = (P, S, D)$$,与使用该基准的 AI 系统相互独立。一次运行将基准与 AI 系统绑定,记作 $$R = (B, AI)$$。

基准采用 canonical YAML 编写,每个语义概念只有一种合法语法,统一归入共享的任务/领域/语言本体(ontology)。YAML 在编译阶段被确定性地转换为 canonical JSON 中间表示,供引擎执行。编译仅改变表示形式,不修复无效定义,也不注入隐藏的默认值。

程序使用 固定的命名输入/输出字段模式,其中 叶子输出字段 直接对应评分维度。引擎向外部 AI 系统公开唯一的运行时契约:接受一个 命名字段输入对象,返回一个 命名字段输出对象。外部系统只需在边界处适配该契约,基准的语义不受集成细节影响。

本文阐述了以下核心内容:

附录中给出了首个引擎实现的规范工程合同,明确了实现细节与兼容要求。

点评:Benchy 通过统一的 YAML‑>JSON 编译链和单一运行时接口,成功将基准定义与 AI 系统实现解耦,为跨平台、跨模型的任务导向评测提供了可扩展且可验证的基础设施。

原文链接: https://arxiv.org/abs/2609.30550

[h] 返回首页