几个月前,MIT Senseable City Lab 的研究者在《How AI Sees the City》中展示了利用机器学习从全市 331 个交通摄像头识别车辆类型并估算每辆车排放的案例。只要摄像头足够多,视觉 AI 就能以前所未有的精度和规模监测排放。
研究人员把每张城市照片视作数据集,使用计算机视觉技术将图像转化为可量化的城市特征。正如 MIT 的法比奥·杜阿尔特所说:“我们可以把数字图像当作数据,量化城市的特征”。
本书《How AI Sees the City: Urban Visual Intelligence》由杜阿尔特、马扎雷罗、卡洛·拉蒂和北京大学的张帆合著,阐述了视觉 AI 在城市规划中的广泛应用,包括交通拥堵原因分析、交叉口安全评估、广场与公园的人流分布等。
作者回顾了城市视觉研究的传统,从罗马的石板地图、摄影时代的城市影像,到凯文·林奇和威廉·怀特的城市形象理论,指出视觉 AI 是对这些传统的技术延伸,使我们能够在更大尺度、更细粒度上观察城市。
视觉 AI 的潜在应用不仅限于排放和交通流,还包括街道活动、步道使用、城市绿化等。卫星影像可以显示树冠覆盖率,而手机等来源的近乎全覆盖的照片则能揭示人们日常生活中看到的绿化程度,这与居民的幸福感密切相关。
张帆指出,视觉 AI 的真正价值在于把图像中可见的街道、建筑、绿地、交通等要素与城市功能和人类体验的大问题相连接。
另一个有趣的案例是利用 40 万条 Airbnb 房源图片分析室内设计风格,结果显示全球室内风格并未趋同,而是呈现显著的地域差异。
然而,作者也警示了技术的风险。大规模摄像头部署带来的监视侵入性以及 AI 系统可能放大社会偏见是主要担忧。伦敦每平方英里约有 210 台摄像头,而上海等中国城市的密度更高,超过 5,000 台每平方英里。
如果 AI 模型主要基于多数群体的数据进行训练,少数群体的评估可能出现偏差。杜阿尔特强调:“AI 并非中立,取决于我们如何教它”。马扎雷罗补充道:“我们的眼睛也不中立,每种工具都需要正确引导和最佳训练”。
该书获得了学界好评,例如 UCL 的 Michael Batty 称其为“引人入胜的著作”,展示了如何利用城市分析、AI 与大语言模型改进城市设计。
作者最终呼吁,在探索视觉 AI 的同时保持谨慎、批判和创造性,以实现对城市功能的更深理解和改进。
点评