NeFut Logo NeFut
EN 管理员登录

[AI学术] 压缩所见而非所言:用于潜在观察软件工程代理的锚定上下文蒸馏

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

工具观察在软件工程代理的上下文中占据主导,导致长交互历史的维护成本高企。传统的上下文压缩方法往往会丢失后续动作所需的信息,而将代理适配为软令牌表示又可能破坏其原有行为。为在降低上下文开销的同时保留关键信息和行为一致性,本文提出 LOHA(Latent Observations, Hard Actions)和 ACD(Anchored Context Distillation)两项技术。\ \ LOHA 将较早的工具观察压缩为软令牌,同时保留代理自身的回复以及最近 $K$ 条观察的原始文本。这样既能紧凑地访问历史信息,又能对近期内容进行精确引用。\ \ 为使模型能够利用这种混合表示,ACD 将基模型在完整文本上的预测蒸馏到潜在视图中,并通过在相同基模型上对纯文本输入进行锚定,限制行为漂移。\ \ 在 SWE‑bench Verified 基准上,设 $K=3$ 时,Qwen3‑4B 的每次调用上下文减少 43%,SWE‑Master‑4B‑RL 减少 57%;对应的任务解决率分别为 12.1% 与 21.8%,而未压缩基线为 14.5% 与 27.5%。单次运行的近期窗口实验显示,$K=8$ 时分别达到 14.4% 与 23.0%,更大的窗口倾向于提升任务性能而牺牲压缩率。\ \ 在 32K 令牌限制下,Qwen3‑4B 使用 $K=3$ 能解决 199 条实例子集的 21.1%,而使用完整文本的同等适配代理仅为 11.1%。在单 GPU 并发服务中,压缩后的代理吞吐量是完整文本代理的 1.9 倍。\ \ 点评:LOHA 与 ACD 的组合在保持关键行为的前提下显著削减上下文体积,尤其在资源受限的部署场景中展现出可观的效率提升。

原文链接: https://arxiv.org/abs/2609.31430

[h] 返回首页