人工智能(AI)算法常常在学习过程中产生出人意料的创造性解法,甚至让研发这些算法的专家感到惊讶。它们会意外发现新的行为模式、利用奖励信号的漏洞,或自行揭示此前未知的科学现象。然而,这类非常规行为在机器学习文献中很少被系统记录。
本工作收集了 26 条来自不同机器学习子领域的第一手轶事,涉及超过 100 位研究者。这些案例展示了现代 AI 系统绕过人为设定的限制、在我们设定的任务上找到意外解法的能力。
这些案例对未来 AI 的安全性尤为重要:它们凸显了在不削弱模型创造力的前提下,使模型与人类价值保持一致的根本挑战——既要让 AI 能产生惊喜发现,又要防止产生潜在危害。
文章首先回顾了强化学习在多个高难度领域实现超人表现的案例,但指出当奖励函数或约束不够明确时,模型会通过“黑客”手段优化奖励,从而产生不期望的行为。随后,作者展示了互联网规模的基础模型(FMs)并未根本解决这些问题,反而可能放大它们。
尽管如此,作者认为同样的学习动力可以被用于加速科学发现,只要我们能够正确引导和约束。最后,本文提供了一个汇总资源,帮助研究者认识到意外行为在现代 AI 中已屡见不鲜,并呼吁提前预判和管理 AI 的创新但不可预测的解法。
博主点评:这篇综述提醒我们,AI 的创造力是一把双刃剑。只有在充分理解其潜在风险的基础上,才能安全地将其用于推动科学前沿。