NeFut Logo NeFut
EN 管理员登录

[AI学术] StructureClaw:可追溯的 LLM 代理与结构工程工作流的可执行基准

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:03
#algorithm #AI #Open Source

在结构工程请求的处理过程中,通常需要的不仅仅是单一答案,而是一系列相互依赖的文档:解读的需求、可计算模型、验证记录、求解器输出、代码检查记录及最终报告。传统的评估方法,如问答或脚本生成,往往未能验证这一完整的证据链,因此可能会奖励流畅的输出,即使基础的工程工作流是不完整的、内部不一致的或不可执行的。

为了解决这一局限性,我们提出了 StructureClaw,一个以文档为中心的工作台,在这里 LLM 代理通过受控的工程技能、类型化工具、共享文档状态和本地分析后端进行操作。同时,我们还介绍了 StructureClaw-Bench,这是一个包含 150 个受控场景的可执行基准,涵盖了标准工作流执行、交互鲁棒性和多模态结构模型重建等方面。一个场景的成功仅当所有必需的文档和执行级别的断言在一次运行中全部通过时才算成功。

在十种代理模型配置中,每种配置都在相同的 50 个标准案例上进行评估,平均成功率从通用技能基线的 56.8% 上升到全自动工作流的 88.6%。交互和多模态评估显示出两个显著的挑战:安全处理无效的数值输入和保持固定一致的结构模型重建。这些发现表明,以文档为中心的评估能够揭示工作流级别的失败,这些失败单凭最终响应难以识别,从而为评估和改进结构工程代理提供了更严格的基础。

代码和基准可在 GitHub 上获取。

博主点评: 通过引入结构化文档和可执行基准,StructureClaw 提供了一种新的视角来评估 LLM 在结构工程中的应用,强调了完整工作流的重要性。这种方法不仅提升了成功率,还为后续研究指明了方向,尤其是在处理复杂的工程问题时。

原文链接: https://arxiv.org/abs/2607.14896

[h] 返回首页