验证生成式社会模拟器的常用做法停留在表面有效性,只是描述性地比较涌现的网络结构,缺乏参数不确定性的量化和充分性检验。
为此我们提出一种充分性感知的校准协议,包括 amortized posterior estimation、synthetic identifiability assessment、matched‑sample‑size adequacy check(先验‑预测可达性 + 每个统计量的后验‑预测局部化)、基于诊断的修复以及 statistic‑held‑out audit。
在真实的二手奢侈品转售市场进行验证,数据被划分为四个渠道‑居住地单元,每个单元是买家‑品牌的二分图。前向模型使用一次性离线从语言模型获取的人格画像构建,行为参数在四个单元中均可恢复,但对其中一个参数的校准表现出近似且过于自信。
观察到的网络摘要在所有单元均超出模拟器的可达性参考区间,最显著的偏差是平均购买层级。修复步骤在两单元满足 value‑block 标准,却未能恢复整体充分性;held‑out 审计进一步发现了一个买家‑品类广度分散的缺失,之前的诊断未能捕捉。
通过剖析画像来源,发现语言模型生成的画像相较于平坦规则基线在四个单元均有优势;但在同类品牌重新标记时并未导致一致性下降,说明画像的价值更多体现在结构信息而非品牌身份。
综上,即使不作因果声明,我们也得出结论:缺乏代理交互或买家广度机制的独立聚合模型,无法同时再现市场的购买层级水平、头部品牌集中度、社区结构以及买家广度异质性。
点评:本研究提供了系统化的充分性校准框架,展示了在真实社交网络场景下的可行性与局限,为后续生成式模拟器的评估提供了重要参考。