NeFut Logo NeFut
EN 管理员登录

[AI学术] 基质感知 AI 代理:执行上下文作为一等输入

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#AI #Machine Learning #LLM

自主 AI 代理在选择动作时必须考虑内存、执行时长、计算资源和运行约束,这些因素共同决定计划的可行性。缺失这些执行上下文的规划状态被称为基质盲目。我们通过数值代码生成实验验证这一概念:在高维欧氏距离计算任务中,三种前沿模型(Anthropic Claude Opus 5、OpenAI GPT‑5.6‑Sol、Google Gemini 3.7 Flash)分别在仅给出任务描述或在提供 128 MB RAM 与 10 s 壁钟时间合约的条件下生成代码。

在 14 组仅任务 vs. 合约披露的对比中,13 组的峰值内存显著下降,且所有三组的平均壁钟时间均缩短,最高提升达 3.1 倍。合约披露导致的结构性代码变化包括有界阻塞、保留 float32、上三角遍历以及原位或内存映射缓冲区。

在更严格的 96 MB 合约下,独立抽样的合约披露组取得了以下成功率:Claude Opus 5 为 4/5,GPT‑5.6‑Sol 为 5/5,Gemini 3.7 Flash 为 3/5;对应的仅任务组分别为 0/5、1/5、0/5。合约披露组的平均最大驻留内存(MaxRSS)和壁钟时间分别比任务组低 49‑74% 和 35‑64%。

这些结果提供了受控的概念验证:最小化的执行合约能够促使生成程序主动进行结构性适配,将计算从无约束分配转移到受限资源,从而在实际运行前显著改善资源‑时间特性。

点评

原文链接: https://arxiv.org/abs/2609.05232

[h] 返回首页