NeFut Logo NeFut
EN 管理员登录

[AI学术] PhysAI-Bench:面向自主无人机的 LLM 代理决策基准

发布于:2026-09-23 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #LLM

PhysAI-Bench 是一个专门评估物理 AI 场景中代理决策能力的基准。它从 10,178 条自主 UAV 任务的对话轨迹中自动抽取标准化决策实例,每条实例保留任务上下文、时间依赖、物理约束、模型上下文协议(MCP)工具调用、代理间交互(A2A)、传感器观测以及 AI 原生 6G 网络条件(包括时延、丢包率、吞吐量、边缘负载和网络切片)。评估时仅提供决策前的信息,防止未来信息泄漏,模拟在线决策环境。我们对 29 种基础模型采用两阶段评估流程:在 35 条人工验证的开发集上,基于 12 种零、三、五-shot 提示组合和四种温度设置进行三次运行,挑选出每个模型的最佳配置;随后在 500 条互不重叠的测试实例上冻结该配置并再次运行三次。结果显示 GPT-5.3 达到最高准确率 52.00%,其次是 GPT-5.2(49.40%)和 Grok~4.5(49.07%)。少量示例提示普遍提升性能,而温度对结果影响有限。整体来看,物理 AI 中可靠的代理决策仍是未解难题。数据集已在 https://github.com/maferrag/physai-bench 开源。

点评

原文链接: https://arxiv.org/abs/2609.23695

[h] 返回首页