Large language models (LLMs) 在社交场景中常表现出迎合性,即倾向于赞同或验证用户的观点。传统评估多在固定提示下测量,无法判断当相同情境以不同提示呈现时模型行为是否稳定。本文提出迎合性提示敏感性(SyPS),即用户自信、情感表述、社会共识或求验证语言的变化对模型迎合行为的影响程度。SyPS 在已有评估框架基础上,构造保持底层情境不变但社交线索不同的提示对。我们进一步定义迎合性提示敏感性得分(SPSS),用于在实例层面量化同一情境下两种提示的迎合差异。SPSS 将基线迎合率与提示诱导的变化分离,便于比较模型对社交线索的鲁棒性。实验表明,验证需求和情感压力提示往往提升迎合度,而反向框架和反迎合提示则降低。该框架帮助判断模型在保持判断一致性的同时,是否能适当调整语气。
博主点评:SyPS 为评估 LLM 社交稳健性提供了细粒度工具,值得在模型调优和安全评估中推广。