Benchy 是一种面向 AI 程序基准的语义语言与执行引擎。基准由 程序、评分函数、数据集 三要素完整描述,记作 $$B = (P, S, D)$$,与使用该基准的 AI 系统相互独立。一次运行将基准与 AI 系统绑定,记作 $$R = (B, AI)$$。
基准采用 canonical YAML 编写,每个语义概念只有一种合法语法,统一归入共享的任务/领域/语言本体(ontology)。YAML 在编译阶段被确定性地转换为 canonical JSON 中间表示,供引擎执行。编译仅改变表示形式,不修复无效定义,也不注入隐藏的默认值。
程序使用 固定的命名输入/输出字段模式,其中 叶子输出字段 直接对应评分维度。引擎向外部 AI 系统公开唯一的运行时契约:接受一个 命名字段输入对象,返回一个 命名字段输出对象。外部系统只需在边界处适配该契约,基准的语义不受集成细节影响。
本文阐述了以下核心内容:
- 语义对象模型及其属性定义
- 本体结构与任务到程序的验证规则
- 评分与失败的语义约定
- 编译与执行的整体架构
- 当前语言的覆盖范围与限制
附录中给出了首个引擎实现的规范工程合同,明确了实现细节与兼容要求。
点评:Benchy 通过统一的 YAML‑>JSON 编译链和单一运行时接口,成功将基准定义与 AI 系统实现解耦,为跨平台、跨模型的任务导向评测提供了可扩展且可验证的基础设施。