我们对 Qwen3.8‑27B 进行后训练,使其在韩语回答时呈现特定风格——冗长、使用列表和 Markdown、具备完整的话语结构和特定语域——并评估模型在两个客观上未被目标覆盖的行为上的变化。
第一个行为是对 KoBBQ 中模糊社会问题的回避(基准答案为 UNKNOWN),第二个行为是对证券指引的未被提示的披露。两者的变化主要体现在模型的发射策略上:回答的频率以及输出的字数。
通过匹配目标形式的对照实验发现,回答倾向取决于训练目标本身,而不是提示集合或微调配方。固定提示、配方、数据量和服务,仅更换目标文本时,三种“风格种子”使回答率提升约 $+0.82\text{pp}$,而三种“中性种子”使其下降约 $-1.53\text{pp}$;两组区间不重叠,均值差 $2.34\text{pp}$。长度匹配的对照位于两者之间,另一种保持简短且带有回避语气的对照在不同种子间表现不稳定,导致具体是哪类形式特征驱动仍未确定。
将整体变化分解为“回答倾向项”和“条件组合项”只是代数恒等式,真正的经验信息在于变化的实际落点。跨检查点观察到,变化几乎全部来源于回答倾向,条件组合项始终很小;且该项是在受处理影响的已回答子集上评估的,不能直接解释为潜在偏好。
两条测量结论:① 当回答状态受处理影响时,条件刻板比例的对照并不能识别内容偏好的变化;② 同一构造的两套规则检测器在不同检查点上的一致性从 $0.44$ 到 $0.99$ 不等,且无需任何参考标签即可观察到。
点评