大型语言模型(LLM)在众多基准上取得了显著成绩,但为了对齐主流价值观,往往会产生同质化的回复,难以满足多样化的用户偏好。现有的免训练方法依赖提示工程,占用宝贵的上下文窗口;基于训练的方法在训练结束后基本保持不变,难以在真实环境中进行持续优化。为了解决这些问题,本文提出 COPE(Continual Optimization with Personalized embedding and self‑Evaluation),一种面向稀疏用户反馈的交互场景的持续优化框架。COPE 为每个用户分配可学习的个性化嵌入,并在一次更新中同时完成偏好捕获、自评校准和个性化响应优化。核心创新在于利用模型自评生成代理奖励,即使缺乏显式用户反馈也能进行持续更新。实验表明,在稀疏反馈条件下,COPE 稳定超越强基线,无论是免训练的提示方法还是基于训练的模型,并且可以与检索增强提示(RAP)互补。进一步分析验证了 COPE 的自评可靠性、偏好模式的可解释性、通用能力的稳定性,以及在偏好漂移和不同评估器下的鲁棒性。
点评