NeFut Logo NeFut
EN 管理员登录

[AI学术] 无大纲学习:任务无关的环境预处理

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #Machine Learning #LLM

在让大型语言模型(LLM)代理进入新环境前,它们可以先检查可用的语料库和工具,并构建可复用的资源,如索引、脚本或过程指引。大多数自动适应方法依赖任务示例、轨迹或评估反馈来决定构建什么,而任务无关的已有方法则在事先为特定环境类型固定准备策略。本文探讨更开放的情形:代理能否在没有教学大纲、测试前且不知下游任务分布的情况下自行研究环境并决定准备方式?我们将此形式化为任务无关的环境预处理,即在预算限制下让学习系统探索环境,并为冻结的求解器产出工件。实验比较了无辅助的元代理、配备档案的元代理以及固定的合成练习和语料处理方法,覆盖六个异构基准。结果显示,某元代理变体在五个基准上获得最高的 Avg@3 奖励,而在最大语料基准上固定的语料处理仍居首。增大学习预算并未必提升下游奖励。尽管如此,研究得到的工件显著降低了测试时达到给定分数所需的采样次数,表明可复用的预处理能够将计算从重复的测试阶段转移到任务前的学习阶段。

点评

原文链接: https://arxiv.org/abs/2609.10824

[h] 返回首页