NeFut Logo NeFut
EN 管理员登录

[AI学术] 营销研究中的合成数据:何时评估与信任

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#AI #Machine Learning #LLM

在营销研究中,合成数据的争论常在两极之间:一方面有人认为大型语言模型(LLM)可以取代人类受访者,另一方面则主张完全不使用它们。我们认为更关键的问题不是合成受访者是否可行,而是何时可行。基于 Brand、Israeli 与 Ngwe(2026)的工作,我们作出三点贡献。\ \

  1. 合成数据的三类:\
    • 未基于真实信息的 LLM 回答(ungrounded LLM responses)\
    • 基于细分的角色设定(segment‑level personas)\
    • 个体层面的数字孪生(individual‑level digital twins)\ 每类对应不同的决策场景,例如宏观趋势分析适合使用未基于真实信息的回答,而精准营销则需要数字孪生。\ \
  2. 准确性度量的四大族:我们将现有度量划分为四类,并指出报告的孪生准确率从接近完美到接近随机,主要源于度量对象不同而非方法本身的优劣。聚合度量在信息输入极少时仍能表现良好,但可能掩盖受访者层面的差异缺失。\ \
  3. 遗忘问题(forgotten question problem):在实际调查中,某些问题可能被遗漏。我们提出利用数字孪生对已有数据进行补全的思路,并设计了一种事前可答性诊断:使用随机森林预测孪生输出,计算其 $R^2$,无需真实标签。\ \ 在对一项全国代表性调查的 108 个态度问题(样本 N=3,063)进行实验时,筛选 $R^2>0.7$ 的问题可使孪生‑人类个体层面相关系数提升 15%,并将“回答质量差”的问题比例从 25.9% 降至 4.3%。嵌入相似度和经验研究者的主观判断也能提供一定筛选能力,但相关性较弱。\ \ 点评
原文链接: https://arxiv.org/abs/2609.13995

[h] 返回首页