NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于假设引导的自蒸馏持续个性化

发布于:2026-09-02 22:00 最后更新:2026-09-03 02:56
#AI #Machine Learning #LLM

随着大语言模型(LLM)助手在日常生活中的使用频率提升,持续适配用户个人偏好成为长期交互的关键。实际场景中,用户的偏好往往并未明确表达,而是通过异构、潜在且噪声较大的信号显现,现有方法要么仅依赖原始交互记录,要么需要昂贵的奖励函数进行优化,难以兼顾可靠性与可扩展性。

我们提出 HypReflect,一个能够从多源用户信号中推断显式、带不确定性的偏好假设的框架。系统会在新证据到来时反思性地更新这些假设,并通过假设引导的自蒸馏机制将用户模型注入到语言模型的生成过程。核心步骤包括:① 从对话、点击、行为等异构数据中抽取潜在偏好特征;② 使用贝叶斯推断构建不确定性感知的偏好假设集合;③ 随交互累积,利用假设的后验分布进行自蒸馏,使模型在保持原有能力的同时逐步强化个性化表现。

在三类典型场景——在线即时个性化、多轮会话持续适配以及基于隐式行为的偏好捕获——的实验表明,HypReflect 相较于仅使用原始历史或增量更新的基线在准确率、用户满意度和鲁棒性上均有显著提升。进一步的跨用户、跨领域测试验证了假设的可复用性和对未见用户的强泛化能力,同时在不同上下文预算下保持稳定表现,能够实现更聚焦且可解释的个性化。

这些结果表明,通过显式、可修正的偏好假设进行自蒸馏,是实现可靠且可扩展的持续个性化的可行路径。

点评

原文链接: https://arxiv.org/abs/2609.00251

[h] 返回首页