NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示模型行为的秘密:使用个性向量审计开放权重LLM

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Machine Learning #Open Source

摘要

语言模型的行为主要在训练后设定,但其表现、隐藏或抵抗的行为并不能仅通过提示揭示。个性向量作为激活空间中的行为方向,可以探测这种组织结构,但之前的研究仅涵盖少数特征。我们首次系统性地应用个性向量,编制了一个涵盖53个特征的清单,涉及四个行为上明显不同的领域,并将每个特征标记为自然(在基线时表达)、可引导但可放大或难以提取(对标准提取具有抵抗力)。

两种模型默认表现出有帮助的、以任务为导向的行为:所有九个自主特征都是自然的,其默认的临床行为与经过认证的心理学家的独立可取性判断在17个特征中匹配16个。引导在这些默认特征排除的特征上产生了最大的增益:夸张、幻觉和谄媚。这种不对称性在所有171对通用特征中都存在:两个可引导特征可以压缩组合,但涉及默认特征的对却永远不会。

在“邪恶”这样的特征上,标准提取失败,但从微调变体转移的向量仍然能够恢复特征,剩余的拒绝出现在模型的思维链中。个性向量作为行为组织的探针比作为控制集更具信息性。

博主点评: 本文通过引入个性向量,为理解和审计开放权重的语言模型提供了新视角,揭示了模型在行为表达上的复杂性,尤其是在处理某些特征时的非对称性。对模型行为的深入探讨为未来的模型优化和应用奠定了基础。

原文链接: https://arxiv.org/abs/2607.13162

[h] 返回首页