MIT Senseable City Lab出版新书《How AI Sees the City》,讨论视觉AI研究城市的可能和风险
四位作者在书中把计算机视觉放进城市视觉研究传统,既展示用 33.1 万路摄像头识别车辆排放等应用,也讨论伦敦每平方英里约 210 个摄像头、上海超过 5000 个摄像头带来的监控和偏见问题。
AI解读:MIT Senseable City Lab的四位研究人员出版了一本关于视觉AI与城市研究的新书,核心主张是把城市中的每张图像当作数据集,用计算机视觉量化城市特征。书中给出的一项案例是用机器学习识别纽约市 331 路交通摄像头中的车辆类型,并估算每辆车的排放。
这本书没有只讲技术好处,也花了篇幅处理监控和偏见。作者认为,密集摄像头的安全收益需要和持续监控对个人自由的侵蚀以及滥用风险一起权衡,同时提醒AI模型如果主要用多数群体数据训练,对少数群体的判断可能不一样。
对城市研究者、规划者和政策制定者来说,这本书更像一份方法说明加风险清单:视觉AI能大规模回答交通、安全、绿化和公共空间使用的问题,但结论是否可靠,取决于数据覆盖谁、模型被怎么训练,以及摄像头的部署是否被公众接受。
MIT Senseable City Lab的四位研究人员本月由Routledge出版了新书《How AI Sees the City: Urban Visual Intelligence》,讨论视觉人工智能用于城市研究的前景和风险。
作者包括MIT首席研究科学家、Senseable City Lab副主任Fábio Duarte,研究科学家、该实验室全球倡议负责人Martina Mazzarello,实践教授、实验室创始人兼主任Carlo Ratti,以及北京大学遥感与地理信息系统研究所助理教授Fan Zhang。
书中引用的一个近期案例是:研究人员用机器学习识别纽约市 331 路交通摄像头中出现的车辆类型,并估算每辆车的排放。作者称,只要摄像头足够多,这类视觉AI技术就有可能在精度和规模上以前所未有的方式监测排放。
视觉AI还能处理交通拥堵成因、不同交叉口最危险的部分、广场或公园哪些区域吸引最多人等问题。Duarte表示,可以把数字图像当作数据来量化城市特征,用计算机视觉技术让每张图像成为一个数据集,但他同时提醒需要谨慎。
把AI放进城市视觉研究的传统里
作者把视觉AI明确放进城市视觉研究的历史脉络中。书中提到,从罗马人建造大理石地图,到摄影术出现后记录奥斯曼改造巴黎、19 世纪纽约下东区公寓拥挤状况,视觉再现一直在影响人们理解城市的方式。
后来,曾任MIT教授的Kevin Lynch在 1960 年出版《The Image of the City》,社会学家William H. Whyte也转向密切观察公共空间。Ratti说,这些城市学者展示了“看”城市的非凡价值,今天视觉AI提供了在先前不可能的规模和细节上观察城市的新方式。
Duarte说,Kevin Lynch在MIT只使用纸和笔,现在可以用视觉AI扩大他做过的事,同时观察城市的许多不同维度。Mazzarello则提出,过去每个人都观察城市环境并试图获得一些洞察,问题是可以大规模地做这件事,并且在各处获得洞察。
从排放监测到室内设计:书中的应用范围
书中讨论的应用范围包括排放、交通流、安全、街面活动和人行道的更好影像,以及城市绿化。卫星影像可以显示一座城市有多少树冠和绿地,来自手机和其他来源的近乎无处不在的图像,则能揭示人们在日常生活中看到绿化的程度,而这一因素与报告的健康状况有关。
Zhang说,视觉AI的真正前景不只是计算机能看数百万张图像,而是能把图像中可见的街道、建筑、绿化、交通、公共空间与城市如何运转、人们如何体验城市的更大问题连接起来。
图像识别也延伸到城市室内空间。Senseable City Lab最近一项研究使用全球 40 万个Airbnb房源图像,显示室内设计风格并没有像某些说法那样在全球趋于同质,而是反映出显著的地理差异。
Mazzarello说,无论具体是什么,都可以从能看到的东西中学习,然后作为城市设计师、规划者、政策制定者和市民来使用它。它可以是我们的眼睛,也可以是带计算机的摄像头,归根结底是同一种方法,现在正在优化使用这些工具的方式。
监控密度和偏见:书中列出的风险
作者在书中列出多项潜在问题,包括广泛视觉监控的侵入性,以及AI系统可能强化偏见。摄像头无处不在会很快引发监控担忧。伦敦是闭路电视的早期采用者,每平方英里约有 210 个摄像头;但全球摄像头密度最高的 10 座城市中有 8 座在中国,上海每平方英里超过 5000 个摄像头。
这类监控做法在世界其他地区也引发争议,美国今年同样出现了关于交通摄像头用途的辩论。在评估密集视频记录可能带来的安全收益时,作者写道,好处必须与持续监控系统对个人自由的显著侵蚀以及固有的滥用可能性相权衡。
AI系统还可能强化社会偏见,产生更多强化既有认知而非底层现实的数据,涉及人、社区和整座城市。如果AI模型主要用多数群体数据训练,它们对少数群体的评估方式可能不同。Duarte说,需要教AI如何看,取决于怎么教,它就会看到文化中嵌入的东西,AI不是中立的。
Mazzarello补充说,人的眼睛也不是中立的,每一种工具都必须以正确的方式引导、以最好的方式训练。
外部评价和作者立场
伦敦大学学院的Michael Batty评价这本书是一本“引人入胜的书”,展示了人们开始如何解释城市设计的世界,并提出了用城市分析、AI和大语言模型改进设计的方式。
作者总体上认为,部署视觉AI来了解城市、城市如何运转以及如何改进,具有很大价值。在谨慎和独立思考的前提下,进展是可能的。他们在书中总结说,应该明智地、批判性地和创造性地探索这件事。