NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过人机交互实现高效测试时适应

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #LLM

AI 代理在大规模数据上训练,具备覆盖众多从业者的广泛能力。但它们产出的成果往往达不到专业人士对个人声誉的要求。在开放式、目标多样且文档不足的任务中,个人专长体现在超越平均水平的提升和偏离。实际操作中,反复的人机交互能够揭示用户无法提前完整描述的评价标准,并在多次任务中重复使用。我们认为,这类跨会话的交互数据是弥合个人专长差距的宝贵信号。为此,我们提出“测试时通过人机交互进行适应”(TAHI),将交互信号注入代理的上下文和权重,并通过一个不断演化的评分模块将每位用户的训练与评估标准具体化。我们在写作和视觉创作两个高价值领域,对30位用户、共600个任务进行适配实验。结果显示,代理在仅数十个任务后,单独任务成功率提升4.5%至20.9%。同时,演化的评分模块作为可扩展的标注工具,能够生成的评估 rubric 比仅使用语言模型或人工标注多捕获16.0%至22.3%的失败案例。尽管适配针对个人,但这些个性化代理在跨用户的任务上也能带来最高8.8%的成功率提升。

点评:该工作展示了交互信号在快速个性化适配中的潜力,为实际应用提供了可行的路径。

原文链接: https://arxiv.org/abs/2609.04141

[h] 返回首页