基准分数只能提供对现代人工智能系统可信度的片面认识。大型语言模型(LLM)、具备自主行为的系统以及多模态模型(MLLM)需要不同的评估方式,但评估证据必须保持可解释,以支持研发和监管。我们提出一个统一框架,将输出层面、轨迹层面和跨模态评估通过八个可信维度相连:能力、鲁棒性、安全性、公平性、透明性、治理、监督和效率。框架在保留系统特有指标的同时,将原始测量映射到统一的性能区间,并提供不确定性估计和可追溯证据。元评估层检验评估本身的有效性、可靠性和可重复性。多维度画像揭示系统的优势与短板,安全关键的覆盖机制防止聚合分数掩盖致命失误。映射到治理框架、国际标准以及欧盟监管要求,使技术评估与监管需求相衔接。该框架为评估系统性能和证据可信度提供结构化依据,后续仍需在实际部署场景中完成实证验证。
点评