开放式大语言模型(LLM)在多模型环境下往往表现出表面多样,却隐藏着同质化的风险:不同系统看似提供独立视角,实则返回相同的默认答案。单轮回答难以区分约束答案空间导致的共识、提示词汇回响以及更宽广答案空间中潜在的稳定备选。为此我们提出 CHOIR(Collective Hierarchically-Ordered Inquiry Responses)框架,借鉴认知人类学中的自由列表法,对 LLM 集合进行多轮排名列表采集。CHOIR 将收集到的条目聚类为提示层面的概念,并在模型、提示变体和人格设定之间测量概念显著性。我们在 Infinity-Chat 100(外部提示库)以及 27 题的针对性诊断库上进行评估。结果显示,CHOIR 能复现高表面一致性(93% 提示显著高于随机),同时区分窄域提示与可恢复深度的宽域提示。跨诊断库和外部提示库,基础模型身份仍是最强的可恢复特征,而人格提示会在同一基础模型内部调动概念的显现。我们还实现了一个盲源排序模块,优先挑选稀有但稳定的候选答案供后续分析。CHOIR 将开放式同质化问题转化为诊断测量任务:模型何处收敛、为何收敛、以及在结构化深度探测下还能触及哪些答案。
点评