公共交通事故数据库正逐步支持自动化安全分析,但在公共部门的决策流程中,事故严重程度预测仍难以直接使用,因为模型通常只被当作普通分类器来评估。本文将痴呆相关车祸严重程度建模重新定义为一个决策感知的分流问题:系统需要把事故划分为无伤/仅财产损失 (O)、轻伤或中度伤害 (BC) 以及致命或重伤 (KA)。同时必须控制结果泄漏、报告严重的低分流率、校准置信度,并保留每一次原始预测以供审计。
我们使用 4,781 条来自德克萨斯州的事故记录,这些记录包含结构化字段和警察叙述文本。数据在 70%/15%/15% 的比例上进行分层划分,分别用于训练、验证和测试。评估的基线包括纯结构化模型、纯叙述模型、融合模型、校准融合模型、BERT 系列模型以及本地大语言模型(Gemma)。在测试划分中,经过泄漏控制的 Gemma 达到最高的宏观 F1 分数 0.545(95% bootstrap CI [0.507, 0.583])。校准最好的融合模型取得宏观 F1 为 0.522,期望校准误差 (ECE) 为 0.033。
选择性延迟(selective deferral)进一步提升了自动分类的性能。当覆盖率设为 70% 时,宏观 F1 上升至 0.573,严重程度成本下降至 0.577。其余 30% 的案例被标记为需要人工复审的候选对象,在本实验中不再进一步评估。本文提供了一个可复现、泄漏受控且具不确定性意识的评估框架,强调审计性和选择性延迟,而非单纯追求准确率。
点评