在安全关键且受物理规律约束的环境中评估大语言模型(LLM)时,仅靠准确率不足以捕捉模型的真实风险。数值上接近真实值的预测仍可能违背操作约束、以物理不一致的方式组合字段,或未能生成可用的结构化输出。现有评估方案难以可靠检测这些失效模式。
我们提出 FLY-EVAL++,一种证据驱动的评估协议。它通过确定性验证模型是否遵循协议、满足物理可行性以及安全约束,并使用固定评分标准将结果聚合为可解释的多维分数。
在飞行轨迹与姿态预测(FTAP)任务上,我们基于 PilotBench 场景扩展为历史条件化和多步预测任务,实现了 FLY-EVAL++ 的具体化。对 66 种 LLM 进行实验后发现,安全合规性是区分模型行为的最关键维度:在预测性能相近的模型之间,安全得分差距超过 28 分。常见失效包括在物理上合理的预测下出现安全违规,以及多步滚动预测的稳定性不足。
这些结果表明,安全关键领域的模型评估必须显式衡量约束满足度和结构化有效性,而不能仅依赖于以准确率为中心的报告。
点评