LUNAR 是一个新的基准测试,用于评估个性化大型语言模型(LLM)在通用用户行为日志上的表现。现有的个性化 LLM 基准测试主要依赖于文本人物或孤立的行为信号,这限制了对跨领域行为个性化的评估。在 LUNAR 中,我们使用了一种多阶段的粗糙到精细的合成管道,基于现实世界的行为模式,来支持大规模基准测试的构建。实验结果表明,LUNAR 的行为数据更接近真实的行为分布。我们在 19 个主流 LLM 上进行了实验,发现访问行为日志是必要但不充分的条件,有效的个性化取决于选择和集成相关证据。直接检索细粒度的行为记录一致地优于压缩内存,但更强的个性化可能会以牺牲隐私保护为代价。这些发现确定了证据选择、跨领域集成和隐私控制作为个性化 LLM 的关键挑战。 博主点评: LUNAR 基准测试为评估个性化 LLM 在通用用户行为日志上的表现提供了一个新的视角,强调了个性化的重要性以及隐私保护的挑战。