摘要
个性化是指在保持发送者、渠道和时间固定的情况下,改变信息以诱导特定接收者采取行动的行为。这在心理学和营销中有着悠久的传统,作为一个双方问题,发送者和接收者有独立的目标。大型语言模型通过生成基于推断的接收者状态的消息变体,消除了经典检索和排序方法的库存限制,这引发了一个问题:当前模型在经典个性化方面的表现如何。
现有的 LLM 个性化基准主要测量发送者侧的适应性,其中接收者是模型所服务的同一用户。对于生成的消息是否能诱导第三方采取预期行动的双方问题,仅通过 A/B 测试和小规模的人类研究进行了调查,这些研究无法根据新模型按需重新运行。我们将 Kamenica 和 Gentzkow (2011) 的贝叶斯说服框架适配于生成代理,并在销售领域实例化该框架,其中接收者的行为通常会记录下来,以便与诱导他们的推广活动进行对比。
我们发布了 SDR-Bench,这是一个包含 6,279 个客户成功案例的公共语料库,涵盖 22 个行业和约 200 家企业,并通过一种时序约束的仿真来提供,防止未来数据泄漏。在前沿的 LLM 和深度研究代理中,我们观察到一个一致的个性化平台,在财富 100 强的科技公司中,没有模型在统计上能够区分成功与失败的推广活动。与 12 位专业销售代表的现场部署验证了该框架,48% 的模型生成内容被立即评为有用,专家一致性达到 Pearson 0.82。我们公开发布 SDR-Arena 和 SDR-Bench,以支持大规模生成个性化研究的可重复性。
博主点评: 本文通过实证研究探讨了大型语言模型在个性化消息生成方面的能力,提出了一种新的基准测试工具 SDR-Bench,展示了模型在实际应用中的表现。这为未来的个性化研究提供了重要的参考和数据支持,具有非常高的实用价值。尤其是在销售领域,个性化可以显著提升客户互动效果,值得深入探索。