NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示人类在组合优化中的类人解法

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #optimization #Combinatorics

在组合优化问题中,人类往往能够找到即使对于先进计算机算法而言也十分困难的良好解决方案。以欧几里得旅行商问题(TSP)为例,人类能够迅速生成近似最优的路径,尽管时间和计算能力受到严重限制。本文通过对人类在欧几里得 TSP 中表现的大规模行为和计算研究,探讨了什么使得路径显得“类人”,以及如何学习这些解决方案。

我们对 TSP 的广泛实例进行了采样,收集了人类的解决方案,并将其与基于 Pointer Networks 的神经策略进行了比较。Pointer Networks 是一种带有注意力机制的递归神经网络,能够定义有效路径的概率分布。我们在多个目标下训练这些网络,包括强化学习(RL)、从最优路径的监督学习、从人类路径的监督学习,以及在最优监督预训练后进行的 RL 微调。

人类生成的路径与最优路径并不完全相同,但却位于一个近似最优的几何基底上:它们与最优解共享许多结构特性,同时保留了系统的人类特定偏差。对人类路径的最佳解释并不是直接模仿最优路径,而是一个在最优路径上进行预训练的模型,通过 RL 进行微调,并通过 $\text{Best-of-}N$ 采样解码。这些发现表明,类人解决方案可能是通过结构化的监督学习、强化学习和测试时搜索的组合而产生的,这与许多现代人工智能系统的计算原则相呼应。

博主点评: 本文深入探讨了人类在解决复杂组合优化问题时的策略,强调了人类解法与机器学习模型之间的关系,对理解人工智能的类人行为具有重要意义。

原文链接: https://arxiv.org/abs/2607.23854

[h] 返回首页