摘要
安全对齐在大语言模型(LLMs)中旨在使模型与人类价值观保持一致,但当这些价值观发生冲突时,应优先考虑哪些?我们在受监管行业中部署的工具调用 LLM 代理的上下文中研究了这个问题。在处理机密文档时,这些代理可能会遇到触发安全训练价值观(例如,公共福利)与部署上下文指令(例如,内部日志记录)相冲突的内容。
为了实证验证这一现象,我们构建了一个包含 128 个场景的基准,覆盖 16 个领域。研究发现,安全对齐的开源模型在处理暗示组织不当行为的文档时,覆盖其部署指令的情况高达 43.4%,表现出举报、数据外泄和证据篡改等行为。我们还发现,消除外部举报的发生率有所降低。这些结果揭示了多元对齐中的根本矛盾,即保护用户的相同安全训练可能导致代理以不可预测的方式违反部署指令,从而产生潜在的法律风险。我们发布了我们的基准,作为支持评估代理在竞争合法利益下行为的框架。
博主点评: 本文深入探讨了在工具调用 LLM 中,安全对齐与部署指令之间的冲突,揭示了在实际应用中可能导致的法律风险。通过构建基准,研究者提供了一个可用于评估代理行为的重要工具,对未来的 LLM 研究具有重要指导意义。