NeFut Logo NeFut
EN 管理员登录

[AI学术] 并非所有 AI 代理都相同:资源与性能动态特征化

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #optimization #LLM

LLM 驱动的 AI 代理通过迭代推理和工具调用来处理用户请求,通常需要调用远程 LLM API 并在本地容器中运行工具。该执行模型使得代理的服务优化变得困难,因为请求之间会交叉出现延迟、资源需求和容器瓶颈。当前的代理生态几乎没有考虑资源动态,导致宝贵资源的大量浪费。

本文以检索增强问答、网页搜索和代码生成三类代表性任务为例,分析了在并发处理多个请求和任务时的资源交叉影响,并对延迟随资源动态的变化进行刻画。测量结果表明,同一工具在不同任务下的资源行为差异显著,且并发请求会暴露出 CPU、磁盘 I/O、内存等任务相关的瓶颈。进一步发现,仅提升 LLM 响应速度或增加 CPU 核心数并不一定能加速代理。

基于这些观察,本文提出了两种利用任务资源特性的优化方案:CPU 感知的工具接入策略和任务感知的 CPU 分配机制。实验显示,针对 CPU 敏感任务的延迟提升约 5.4 倍,多个任务的平均延迟相比原生代理降低约 32%。

点评

原文链接: https://arxiv.org/abs/2609.19947

[h] 返回首页