NeFut Logo NeFut
EN 管理员登录

[AI学术] OPTIMIZE你的问答系统:基于约束的多LLM优化框架

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#algorithm #AI #optimization

摘要

尽管大型语言模型(LLMs)在问答(QA)方面表现出色,但预算部署由于其非确定性和异构资源配置(成本、延迟和能耗)变得复杂。我们提出了OPTIMIZE,一个受数据库启发的基于成本的优化器,它实施了一种先规划后执行的多LLM协同工作机制。

OPTIMIZE将LLM调用建模为执行有向无环图(DAG)中的物理操作符,并针对每个问题搜索优化答案质量(QoA)的计划,同时在用户指定的资源约束下权衡财务成本、延迟和能量。计划可以包括顺序操作符,这些操作符将中间答案作为上下文传递,以及并行/混合操作符,这些操作符同时运行多个模型并合并它们的输出。

为了在不执行每个候选计划的情况下搜索这一空间,OPTIMIZE使用PERFDB,一个从基准和执行轨迹填充和更新的统计目录,以估算单个操作符和组合子计划的QoA和资源成本。利用这些估算,OPTIMIZE执行帕累托前沿搜索,并根据用户偏好选择最终计划。在用户指定预算下,OPTIMIZE在MMLU-Pro和SimpleQA上相较于基线提高了约58%和41%的平均QoA,证明了数据库风格的规划在多LLM问答中提供了更好的质量资源权衡。

博主点评: OPTIMIZE框架通过将问答过程建模为执行图,有效整合了资源管理和问答质量提升的需求。其创新的统计估算方式显著提高了多LLM系统的效率,是未来问答系统发展的重要参考。

原文链接: https://arxiv.org/abs/2607.22621

[h] 返回首页