NeFut Logo NeFut
EN 管理员登录

[AI学术] 代理应驻留何处?面向边缘‑云连续体的能耗‑内存特征分析

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#optimization #LLM #Artificial Intelligence

随着电信网络向自主化的 5G‑Advanced 与 6G 迈进,代理式人工智能工作流——大型语言模型(LLM)进行多步推理、调用诊断工具、检索领域知识并在代理团队间协同——正日益分布在边缘‑云连续体中。生物大脑仅以约 20 W 的代谢功率完成复杂认知,而当代 LLM 的能耗与内存需求却极高,因而实现可持续的生命周期编排成为关键运营任务。现有的 AI 生命周期指标仅衡量单模型推理或忽视多代理执行图,导致网络运营商缺乏模型来评估分布式代理通信的能耗以及代理团队应落址的层级。为填补此空白,我们提出 agentic‑eCAL,将 AI 生命周期能耗(eCAL)指标推广至有向多代理工作流。该指标通过闭式两速率单次调用能耗模型(计算受限的 prefill 与内存受限的 decode)并结合 7 层 OSI 数据传输层进行耦合。基于数百组 NVIDIA A100 与 H100 GPU 基准、16 种开源模型以及 8 种编排拓扑,我们验证了指标的各组成部分并探讨了工作流放置的影响。实验表明,跨 5G RAN、城域网和光纤链路的代理间文本传输仅占工作流总能耗的 0.25%。因此,在边缘‑云的代理部署中,能耗的主要来源并非文本传输本身,而是由通信引发的额外推理与上下文处理。

点评:agentic‑eCAL 为多代理系统提供了可量化的能耗框架,揭示了在边缘‑云环境中,通信开销远低于因信息共享导致的额外计算成本,为运营商的资源调度与绿色 AI 设计提供了实用依据。

原文链接: https://arxiv.org/abs/2609.18283

[h] 返回首页