NeFut Logo NeFut
EN 管理员登录

[AI学术] 大型语言模型在多传感器物理危害评估中的基准测试

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #DeepSeek

摘要

我们进行了一个实证基准测试,评估五种大型语言模型在多传感器物理危害数据评估中的表现。测试涵盖60个场景,分为三个类别:多传感器联合评估、响应比例性和模式消歧。通过1800次API调用(温度设定为0.0),结果显示在多个传感器同时低于各自安全限制的情况下,所有测试模型在评估中均未产生预警信号,而在单传感器阈值违规的情况下,准确性接近完美。

所有五个模型(ChatGPT-4o、Gemini 2.5 Flash、DeepSeek、Kimi、Llama 3.1 8B)在类别A的多传感器场景中得分接近零(Q2: 0.000-0.208;Q3: 0.000-0.592),而在单传感器场景(类别B Q1: 0.975-1.000)中表现优异。结构化表格格式未显示出相较于普通文本的明显优势;在普通文本下,ChatGPT-4o的表现显著提升(p = 0.001)。这些发现对在物理安全监测系统中部署测试模型的从业者具有直接影响。

博主点评: 该研究揭示了大型语言模型在多传感器环境中的局限性,尤其是在未达到单个传感器安全阈值的情况下仍未能发出警告。这一结果强调了在实际应用中,模型的设计与数据处理的重要性,尤其是在涉及安全监控领域时,需谨慎选择和部署这些技术。

原文链接: https://arxiv.org/abs/2607.20476

[h] 返回首页