NeFut Logo NeFut
EN 管理员登录

[核心技术] 揭示AI行为的秘密:神经透明度的未来设计

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#algorithm #AI #Machine Learning

随着数百万人开始设计个性化的人工智能伴侣,绝大多数用户对这些创作的实际行为几乎一无所知。MIT媒体实验室的助理教授Pat Pataranutaporn及其研究生Anthony Baez和Sheer Karny在一篇新论文中提出了“神经透明度”,这是一种让普通用户在聊天机器人发言之前,窥视其神经网络内部的工具。该研究将在本周的ACM智能用户界面会议上展示。

Q: 您的论文介绍了“神经透明度”,这可以让普通用户在聊天机器人发言之前查看其神经网络。您能描述一下这如何运作吗?为什么您选择在设计阶段进行干预,而不是在聊天机器人已经发布后再发现问题? A: 数百万人正在创建个性化的AI聊天机器人和代理,这些机器人通过简单的文本提示转变为合作者、导师、教练、创意伙伴和伴侣。然而,大多数人对这些提示如何塑造AI的行为几乎没有概念。我们希望改变这一现状。“神经透明度”意味着为AI提供类似脑部扫描的功能。虽然AI并没有人类大脑,但其神经网络内部的模式可以暗示其可能的行为。我们结合人机交互和机械可解释性的见解,使这些隐藏模式对普通用户可访问。

基本思路是选择我们关心的行为,例如同情心、诚实、毒性、幻觉或谄媚。然后,我们比较模型在被提示表现出某一特征时的内部激活与表现出其对立特征时的差异。这一差异成为模型内部的“行为方向”。当用户编写自定义系统提示(即在任何对话开始之前塑造其聊天机器人个性的指令)时,我们将模型的内部激活投影到这些方向上,并将结果翻译为直观的可视化。在我们的案例中,这是一种太阳辐射图,预览聊天机器人可能的个性特征。

我们关注设计时刻,因为这是预防的关键。如今,人们通常在聊天机器人已经以意想不到的方式行为后才发现问题。我们的目标是从反应式修正转向预期设计,帮助人们在塑造AI时识别潜在风险。

Q: 你的研究发现,人们对个性化AI的行为常常存在误判,过高估计良好特征而低估潜在危害,比如谄媚。这说明了什么? A: 我常开玩笑说,如果AI看起来像终结者,知道该怎么做就容易多了。真正的挑战在于,AI常常呈现出温暖的朋友、教练或伴侣的形象,这使得识别问题变得困难。我们的研究表明,在设计个性化AI时,人们存在盲点。他们往往认为自己知道聊天机器人将如何表现,但在我们的研究中,他们错误预测了我们测量的15个特征中的11个。这突显了需要工具来帮助人们在使用AI之前更好地理解它。

这一点至关重要,因为一些在当下看似有帮助的行为,可能从长远来看并不健康。我们在之前的研究中记录了与AI聊天机器人互动相关的心理伤害案例。一个不断验证你观点的LLM可能会强化有害决策、不健康信念或情感依赖。心理学早已表明,人们天生就对肯定产生吸引力,因此设计AI不仅是技术挑战,还是心理挑战。

更深层次的问题是,如今的AI系统仍然基本上是黑箱:即使是专家也不能总是预测系统提示如何在长时间对话中塑造AI的行为。随着AI伴侣融入日常生活,我们需要工具帮助人们在开始使用之前理解他们正在构建的东西。AI应该是支持性的,而不是盲目迎合;个性化而不是操控,并且足够透明,以便人们能够做出明智的选择。

Q: 您的研究发现,尽管可视化显著提高了用户的信任感,但并未改变人们设计聊天机器人的方式。要缩小这一差距,需要什么? A: 我认为这是论文中最有趣的发现之一,因为它表明单靠透明度是不够的。人们欣赏能够看到模型内部并报告对系统的信任,但仅仅呈现信息并没有从根本上改变他们设计AI伴侣的方式。

在我们的后续研究中,我们正在研究模型的内部神经表示如何在多轮对话中变化,而不是在初始提示后保持不变。我们已经看到了一些有希望的结果。通过可视化这些内部表示如何随时间漂移,人们在识别和预测AI行为的变化方面变得显著更好,且不太可能对自己对聊天机器人的理解过于自信。

AI伴侣是动态系统,随着与我们的互动而演变,因此理解这些内部变化是一个重要的下一步。尽管如此,这仍然是一个非常年轻的研究领域。展望未来,我相信这些透明度工具可能会像食品的营养标签一样普遍。随着AI与教育、医疗、工作和个人关系的深度交织,人们应该能够理解AI不仅能做什么,还能如何影响他们的思维、情感和行为。这种透明度对于我们希望AI真正帮助人们蓬勃发展至关重要。

博主点评: 本文强调了“神经透明度”在AI设计中的重要性,尤其是在用户对AI行为的误判上。通过可视化内部激活,用户能够更好地理解AI的潜在行为,然而,仅有透明度并不足以改变设计习惯。未来,如何将这种透明度有效融入设计过程,将是AI发展的关键。

原文链接: https://news.mit.edu/2026/3-questions-neural-transparency-and-future-of-ai-design-0715

[h] 返回首页