NeFut Logo NeFut
EN 管理员登录

[AI学术] Asclepius:面向长时程临床智能体的自适应框架

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#Machine Learning #LLM #Artificial Intelligence

LLM 智能体的评估大多局限于短时、单任务的轨迹,而真实部署往往需要在数小时的高负荷环境中持续运行,这会暴露出一类不同的失效模式。我们使用临床环境模拟器(CES)作为测试平台,在该平台中,智能体需要在连续的时间和资源压力下管理整个急诊科轮班。长时程执行失效在一次完整的 rollout 中即可通过结构化、多维度的评分体系被量化。实验表明,现有智能体在大多数情况下能够给出正确的诊断,但在关键动作的完整性和时效性上表现不佳,形成了执行缺口。我们将该缺口归结为三种长时程失效模式,并用每条轨迹的计数器进行量化:指令遵循漂移、治疗不完整以及严重性‑公平性时效差距。针对这些问题,我们提出了 Asclepius——一种自适应的智能体支架。它包括一个在轮班之间根据轨迹反馈自动重写操作手册的自进化框架、一个用于高风险治疗方案的外部临床技能库,以及三个相互隔离的子智能体,用于在患者队列中分配每一步决策。在未见过的测试批次上,Asclepius 将关键动作的正确率提升了 22%(p = 0.024),同时保持诊断准确率,并在来自三类模型的五位 LLM 评审员中表现一致;在全部十个批次的完整评估中,关键动作提升达 25%,时效性提升 13%。这三种失效模式形成了耦合瓶颈,只有三项技术协同作用时才出现显著的改进。

点评:Asclepius 通过自适应手册更新、技能库外部化和决策子模块化,有效弥补了长时程临床智能体的执行缺口,为真实医疗场景的部署提供了可行路径。

原文链接: https://arxiv.org/abs/2609.13543

[h] 返回首页