大型语言模型(LLM)代理能够自行推理、调用工具并执行多步操作,但它们在工具序列化、依赖规划、对不可信输入的判断以及论证落地等方面的能力难以仅靠排行榜的准确率来衡量。BekchiAI 同时提供了衡量这些能力的基准和实时观察、控制代理的平台。
BekchiAI‑Benchmark 包含 13 种使用 ReAct 框架的工具型代理,覆盖算术、结构化/SQL、漏洞检测、URL 落地、规划、编排和工具策略 7 大任务类别,共计 2,057 条确定性、已提交的测试任务。每条任务的金标准答案通过运行真实数据库的规范 SQL、计算有向无环图(DAG)的精确调度,或评估闭式 lambda 表达式得到;安全类任务使用对抗样本并配合有意不完美的签名扫描器,使得得分反映模型自身的判断而非对 oracle 的复制。
除了准确率,BekchiAI 还定义了工具调用遵循度、URL 幻觉率、来源匹配率以及每模型的 token 成本等行为度量。四个模型(Qwen3.7‑Max、gemma‑4‑31B‑it、gemma‑4‑26B、gpt‑oss‑120B)的对比显示,差异主要体现在同一模型族内部的表现分布,而非整体优劣。基准的运行依赖提供的评估脚本。
BekchiAI‑Platform 是配套的网页化可观测与控制层,能够实时记录 token 与延迟指标,并支持远程终止运行。基准、评估工具和平台均已开源发布。
博主点评:BekchiAI 将评测与可观测性合二为一,为 LLM 代理的研发提供了从微观行为到宏观成本的全景视角,尤其是对安全与工具策略的细粒度度量,值得社区深入探索。