
多模态大模型能否真正理解城市福祉?此前的探索工作当大模型开始“读懂城市”:CityLens让社会经济感知进入可评测时代中,我们介绍了一个面向城市社会经济感知的多模态评测基准,系统回答了一个重要问题:大模型能否从卫星图像和街景图像中“看见”城市的社会经济特征?
然而,对于城市智能而言,这只是第一步。一座城市不仅有经济发展水平,还包括环境质量、空间可达性、城市活力以及居民的主观感知等维度。 这些共同构成了"城市福祉(Urban Well-being)",也是智慧城市建设和可持续发展的核心目标。
近日,北京中关村学院联合赫尔辛基大学、香港科技大学(广州)、牛津大学等发布 UrbanWell:首个面向城市福祉(Urban Well-being)的多模态评测基准,系统评估视觉语言模型能否基于卫星图像、街景图像及其时序信息,理解并预测真实世界中的环境、空间、活力与感知等多维城市指标,为 AI 驱动的城市分析与可持续发展研究提供了统一的评测平台。

• 论文标题:UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics
• arXiv 地址:https://arxiv.org/pdf/2606.15890
• 代码链接:https://github.com/axin1301/UrbanWell-Benchmark/
为什么要做UrbanWell?
随着多模态大模型(MLLM)的快速发展,人们开始尝试让AI理解真实世界中的城市环境。从街景到卫星图像,大模型已经能够描述道路、建筑、绿地等视觉内容,但一个更重要的问题仍然没有答案:它们真的能够理解一座城市的福祉(Urban Well-being)吗?
城市福祉不仅包括空气质量、绿化水平等客观环境,也涉及设施可达性、人口活力、安全感、美观度等多维因素。这些指标直接影响居民生活质量,也是智慧城市建设、城市治理和可持续发展的重要依据。然而,目前针对城市福祉的大模型研究仍然面临三个共同问题:
(1) 缺乏统一的数据基准,不同工作采用不同数据来源和评价指标,结果难以比较。
(2) 评测范围有限,大多数研究只关注单一指标(如人口、空气质量),难以全面反映城市福祉。
(3) 缺少真实世界验证,尚不清楚大模型究竟是在真正理解城市环境,还是仅仅学习到了个别任务中的统计规律。
与此同时,卫星影像、街景影像以及多年的城市数据正在持续积累,为 AI 理解城市提供了前所未有的数据基础。一个自然的问题随之出现:如果大模型已经能够“看懂图像”,它是否能够进一步“理解城市福祉”?
UrbanWell想回答的,正是这个问题。它构建了首个覆盖环境、城市可达性、城市形态、活力和感知五大维度的城市福祉评测基准,通过多任务时序评测,系统揭示当前多模态大模型理解城市福祉的真实能力边界,为未来 AI 驱动的城市分析提供统一、可靠的评测平台。
UrbanWell做了什么?
我们构建了一个面向全球城市的系统化城市福祉评测框架,核心特征包括:
- 38个全球城市,覆盖不同国家、发展阶段与城市形态
- 5大城市福祉领域:环境、空间可达性、城市形态、城市活力、主观感知
- 19个代表性指标,涵盖空气质量、绿化水平、设施可达性、道路网络、人口活力、安全感、美观度等多维城市特征
- 15个主流MLLM的系统评测
- 3类核心任务:
- 单年份(静态)预测任务(Single-year Estimation)
- 多年份(时序)预测任务(Multi-year Forecasting)
- 多年份变化趋势分类任务(Temporal Trend Classification)

从原始数据到UrbanWell

“能不能做评测” 只是第一步,“评测是否可信”才是关键。UrbanWell在数据构建上并不是简单收集图像和标签,而是围绕城市福祉评测,形成了一套完整的数据处理流程。
1) 多源数据采集
UrbanWell首先整合了多种真实世界城市数据,包括卫星影像、街景影像、开放地图数据、遥感产品以及城市统计与感知指标。这些数据共同覆盖了城市福祉的不同侧面:有些指标来自空中视角,例如绿化、空气质量和城市形态;有些指标更依赖街道视角,例如安全感、美观度;还有一些指标需要结合地图统计数据,例如设施可达性、人口活力和道路网络。

2)城市福祉指标体系构建
在指标层面,UrbanWell围绕五大城市福祉领域构建评测任务:环境、空间可达性、城市形态、城市活力和主观感知。最终,UrbanWell形成了包含19个代表性指标的城市福祉评测体系。这些指标既包括空气质量、绿化水平、道路密度、人口分布等客观指标,也包括安全感、美观度、压抑感等主观感知指标,使UrbanWell能够同时评估模型对“城市结构”和“居民体验”的理解能力。
3)空间与时间对齐
UrbanWell 不只是 “有很多数据” ,还包括将不同模态、不同年份、不同来源的数据对齐到统一的城市空间单元中。每个样本都与对应区域的卫星图像、街景图像、年份信息和真实城市福祉标签相连接。这样做可以确保模型看到的视觉信息与要预测的指标在空间和时间上严格对应,避免因为数据口径不一致而影响评测可信度。
4)任务构建与评测协议统一
在完成数据对齐后,UrbanWell 进一步将数据组织成三类核心任务:
- 单年份(静态)预测任务(Single-year Estimation):根据某一年份的卫星图像和街景图像,预测该区域对应的城市福祉指标。
- 多年份(时序)预测任务(Multi-year Forecasting):利用历史年份的多模态城市数据,预测未来年份的城市福祉指标。
- 多年份变化趋势分类任务(Temporal Trend Classification):判断某项城市福祉指标在不同年份之间是上升、下降还是保持稳定。
通过这三类任务,UrbanWell 不只是评估模型能否“看图猜数值”,还进一步考察模型是否能够理解城市福祉的空间差异、时间演化与变化趋势。最终,UrbanWell 将多源数据、五大领域、19 个指标、三类任务和统一评测协议整合到同一框架中,使不同模型能够在相同规则下公平比较,也让城市福祉感知真正进入可复现的评测阶段。
我们看到了什么?
1) 单年份(静态)预测任务(Single-year Estimation)
不同城市福祉指标的难度差异非常明显。具有直接视觉线索的指标更容易预测,而环境、人口等复杂指标仍然存在较大的误差(RMSE)。不同模型在不同城市福祉任务上各有所长,说明当前大模型的城市理解能力仍然具有较强的任务依赖性。

2) 多年份(时序)预测任务(Multi-year Forecasting)
相比静态预测,多年份历史信息能够明显降低预测误差(RMSE),提高模型对城市发展的刻画能力。但不同指标的预测难度依然存在明显差异。即使利用时间序列信息,一些复杂城市指标仍然难以准确预测,说明长期城市演化规律尚未被模型充分学习。

3) 多年份变化趋势分类任务(Temporal Trend Classification)
变化趋势识别仍然是当前模型的难点。城市形态等具有直接视觉表现的指标(准确率)表现相对较好,而环境和主观感知类指标仍具有较大挑战。

4)不同城市之间存在显著差异
即使是同一个模型,在不同城市上的预测误差也存在明显差异。有些城市能够获得较好的预测结果,而另一些城市仍然较难准确建模,说明城市环境的异质性会直接影响模型性能。

5)卫星图像的作用取决于指标和任务
卫星图像对环境指标帮助有限,但对主观感知和城市结构类指标更有价值,尤其在单年份(静态)预测任务中更明显;到了多年份(时序)预测任务中,贡献则变得不那么稳定。

6)更多街景图像不一定持续带来提升
增加街景图像数量并不会在所有指标上稳定提高性能。环境指标对更多街景视角不敏感,主观感知指标更容易受益,而城市形态类指标可能出现非单调变化,说明更多视角既可能补充信息,也可能引入冗余或噪声。

7)视觉模态能提供历史数值之外的补充信息
在多年份预测中,加入卫星和街景图像能够提升部分指标表现,尤其是 PM2.5 和美观度。相比之下,道路指标的变化较小,说明视觉信息的贡献同样具有指标差异。

8)历史时间信息重要,但不是越长越好
加入历史年份信息通常能够降低预测误差,说明时间上下文对多年份预测很重要。但更长的历史序列并不总能带来更好结果。

9)微调能提升性能,但不能消除任务难度差异
LoRA 微调提升了单年份预测表现,尤其是人口和 CO₂ 预测。多年份预测中的提升相对较小,说明 UrbanWell 中的挑战并不只是 zero-shot 设置带来的,而是来自不同指标本身的复杂性。

UrbanWell的意义
UrbanWell 不只是一个城市福祉数据集,更是一个面向多模态大模型的统一评测框架:
- 帮助我们系统评估视觉语言模型理解城市福祉的真实能力边界。
- 揭示不同城市福祉指标、不同视觉模态以及不同时间尺度对模型能力的影响。
- 为下一代面向智慧城市、城市治理和可持续发展的城市 AI 提供统一的评测基准。
UrbanWell的潜在应用场景
- 城市福祉动态监测:结合卫星影像、街景影像和历史数据,持续跟踪空气质量、绿化水平、人口活力等城市福祉指标的长期变化,为城市治理提供量化依据。
- 城市更新与规划评估: 在城市更新、新区建设或公共空间改造前后,自动评估环境品质、设施可达性和居民感知变化,辅助评价规划实施效果。
- 智慧城市智能感知: 利用多模态大模型快速感知城市环境、空间结构和居民体验,为城市精细化管理、资源配置和公共服务优化提供数据支持。
- 城市数字孪生与未来预测: 将多模态城市观测与时序预测结合,为城市数字孪生、城市发展模拟以及未来福祉趋势分析提供基础能力,辅助科学决策与可持续发展。
下一步:从“能理解”到“真正理解城市福祉”
UrbanWell 的实验表明,当前视觉语言模型已经具备一定的城市福祉理解能力,但距离稳定、可靠的真实应用仍有明显差距。即使经过领域微调,模型性能能够显著提升,不同城市、不同指标之间的难度差异依然存在。
这意味着,城市福祉分析正在进入一个新的阶段:从通用视觉语言模型的初步探索,迈向面向城市智能的专用基础模型。
作者团队及合作单位
本文第一作者来自赫尔辛基大学博士生席彦新,通讯作者为北京中关村学院助理教授冯杰、赫尔辛基大学副教授Xiang Su和香港科技大学讲席教授许彬。该研究依托北京中关村学院自由探索项目“面向城市开放空间的空间智能与多智能体协同研究”开展,研究团队长期聚焦以城市开放空间为核心对象的空间智能及智能体技术研究,致力于推进人工智能与物理世界、人类社会的深度融合。



