走进学院
学院资讯
科研动态
学生培养

当大模型开始“读懂城市”:CityLens让社会经济感知进入可评测时代

日期: 2026-05-29

城市的活力、发展机会,是否真的可以从一张街景图里被看见?

不同区域的生活质量差异,能否通过视觉数据来量化?

大模型能否真正“读懂”一座城市的社会经济状态?

近日,北京中关村学院联合清华大学、香港科技大学(广州)发布CityLens一个面向城市社会经济感知的多模态基准,系统评估视觉语言模型(LVLM)能否从卫星图像与街景图像中,预测真实世界中的社会经济指标。该工作已正式被国际机器学习顶级会议ICLR 2026接收。

• 论文标题:CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

• arXiv 地址:https://arxiv.org/abs/2506.00530

 

为什么要做CityLens

在城市治理中,GDP、房价、教育、健康、交通、环境等指标,直接关系到资源配置、公平治理与长期发展。

但现实里,社会经济统计往往有三个共同难题

1. 数据更新频率低,难以快速响应城市变化。

2. 采集成本高,很多细粒度指标很难持续维护。

3. 空间分辨率有限,难以支撑社区尺度、街区尺度的精准分析。

与此同时,街景与卫星影像正在持续积累,覆盖广、更新快、空间定位明确。一个自然问题出现了:如果大模型已经能够“看图说话”,它能不能进一步“看图感知城市社会经济状态”?

过去几年,领域内已经有不少尝试:有人做视觉特征学习,有人做文本增强,也有人用LLM直接做估计。但我们始终缺一个统一答案:

• 在跨城市、跨指标设置下,LVLM的真实能力边界到底在哪里?

• 直接预测、归一化估计、特征回归三种范式分别适合哪些任务?

• 模型到底是“真正看懂了城市”,还是只在个别任务上偶然有效?

CityLens想解决的,正是这个“缺乏统一评测”的核心痛点。

CityLens做了什么?

我们构建了一个面向全球城市的系统化评测框架,核心特征包括:

• 17个全球城市,覆盖不同发展阶段与城市形态

6大城市领域:经济、教育、犯罪、交通、健康、环境

11个代表性指标,从可观测到抽象指标全面覆盖

17个主流 LVLM 的系统评测

3种评测范式:

    - Direct Metric Prediction(直接数值预测)

    - Normalized Metric Estimation(归一化估计)

    - Feature-Based Regression(特征回归)

从原始数据到CityLens

“能不能做评测”只是第一步,“评测是否可信”才是关键。CityLens在数据处理上重点做了三件事。

1) 多源采集与指标筛选

我们先构建候选指标池,再进行任务化筛选。筛选逻辑不是“越多越好”,而是围绕三个原则:

1. 指标有明确空间对应关系,能够对齐到区域单元。

2. 指标在视觉上存在潜在线索,避免完全不可观测任务。

3. 指标之间尽量减少语义重叠与高度共线,提升评测信息增益。

例如,在候选指标中,我们结合相关性分析与可解释性考量,最终保留了11个更具代表性的任务,确保benchmark既有挑战,也有可分析价值。

2) 空间对齐与样本构建

CityLens的基本样本单元是“区域级”而不是“单图级”。每个区域会关联:

1. 1张卫星图像。

2. 10张街景图像。

3. 对应的社会经济指标标签。

这一步的关键价值在于:

• 让模型看到同一区域的多视角线索,而不是单一视角。

• 让影像信息与统计标签在空间上严格对应。

• 让后续模型比较在同一数据底座上进行,避免“数据口径差异”带来的伪差距。

3) 评测协议统一化

除了数据本身,CityLens还把任务定义、提示模板、评估指标和对比设置统一起来。这样做的目的很直接:让不同模型在同一规则下可比,让结果能够被复现和诊断。

三种评测范式,分别在测什么?

CityLens不是只问“模型能不能猜一个数”,而是分层评估模型能力。

1) Direct Metric Prediction(直接数值预测)

直接输出具体数值,最贴近真实应用场景,也最考验模型把视觉线索映射为真实数值的能力。

2) Normalized Metric Estimation(归一化估计)

将任务转为相对尺度或归一化区间,预测社会经济“水平”,降低绝对数值难度,更关注模型对区域排序和相对关系的把握。

3) Feature-Based Regression(特征回归)

先由LVLM提取城市视觉特征,再用回归器完成预测。这个范式可以把“感知能力”和“回归能力”拆开,便于诊断问题到底出在视觉理解,还是出在数值映射。

这三种范式结合起来,才能更接近真实问题:模型究竟是“看到了”、 “理解了”,还是“稳定地量化了”。

我们看到了什么?

1) 任务难度远高于直觉

即使是当前SOTA模型,在大量任务上仍出现低R²,甚至负值。换句话说:“看见”不等于“理解并量化”。模型在社会经济感知上仍有明显短板,尤其是在跨区域泛化与数值稳定性方面。

2) 可视线索强的任务更容易

像“建筑高度、公共交通、GDP”这类与视觉结构关联较强的任务,整体表现更好;而“心理健康、预期寿命”等抽象指标仍然极具挑战。这类指标受生活方式、社会关系、长期健康机制等潜变量影响更大,纯视觉线索往往不足。

3) 不同任务偏好不同预测方式

一些任务,如GDP、人口,更适合“归一化估计”(强调排序关系);另一些任务,如房价、公共交通率,更适合“直接预测”(强调绝对值映射)。

这说明:任务本身的可观测性、语义抽象程度与数值分布特性,会决定其更适配的预测范式。这也为后续研究提供了明确方向:围绕任务特性进行方法选择与模型设计,而非追求单一统一范式。

4) 城市之间存在显著差异

在GDP任务中,不同城市表现差异明显:

• 部分城市可达到较高R²(如上海、旧金山、圣保罗)

• 也有城市接近0甚至为负

这提示我们:模型效果不仅由“模型大小”决定,还与城市视觉结构、数据覆盖质量、社会空间异质性密切相关。

5) “更大模型”不总是“更好模型”

同一系列中,参数规模增大并不必然带来稳定提升。从实验结果可以看到,某些中等规模模型在具体任务上反而优于更大版本。这意味着在城市社会经济感知中,模型的训练目标、视觉编码器特性、跨模态对齐方式,可能比“参数更多”更关键。

6) 输入组成会显著影响结果

实验显示,街景信息在不少任务中贡献更直接,卫星图像更多提供宏观结构补充。另一方面,增加街景视角数量通常能带来可观增益,说明“多视角上下文”对模型判断非常重要。

这对实际部署很有启发:

1. 不是简单“多模态越多越好”,而是要看任务。

2. 数据采样策略本身就是性能瓶颈之一。

7) 推理增强并非万能

CoT在部分任务上有效,但在某些任务上反而带来退化。原因可能在于一些城市指标更依赖直接视觉线索,而非冗长链式推理。推理模型对比结果也能看到这种不稳定性,并不存在“一个推理模型在所有任务都更强”的现象,不同模型在不同指标上各有胜负。

这进一步说明,城市社会经济感知不是“把通用推理模板套上去”就能解决的问题,需要更贴合任务机理的提示与推理策略。

8) 错误案例分析:问题到底卡在哪里?

如果把模型失误拆开看,问题大致出在两步:先“看错”,再“想偏”。

第一类是感知阶段的偏差。模型可能漏掉小但关键的街景线索,或者对局部元素出现误判,这些早期误差会一路传导到后续预测。

第二类是推理阶段的偏差。即使看到了不少信息,模型也可能过度依赖局部细节、忽略整体环境,最后把结论带偏。

这给我们的启发很直接:城市社会经济感知要提升,不能只靠“换更大更强模型”,还要一起优化感知质量、特征表达和推理策略

CityLens的意义

CityLens不只是一个“排行榜”数据集,更是一个诊断框架:

• 帮助我们识别LVLM在城市任务中的真实能力边界

• 揭示哪些城市指标更依赖视觉线索、哪些更依赖社会语义

• 为下一代“可解释、可迁移、可落地”的城市AI提供研究基线

不止于评测:CityLens部分潜在应用场景

城市活力的动态观察通过分析同一区域不同时期的街景图像,自动识别商铺更替、公共空间使用强度、人行道活跃度等变化,为改造效果评估提供量化依据。

公共服务设施配置优化:基于街景识别学校、医院、养老设施周边的环境品质(如步行友好性、绿化覆盖率、道路安全性),辅助判断设施布局的均衡性与可达性。

城市环境日常体检自动检测街景中的垃圾堆积、占道经营、绿化缺损、市政设施损坏等现象,替代或辅助人工巡检,提升城市精细化管理效率。

跨城市发展比较研究:量化比较不同城市、不同社区的外部环境特征(如建筑风貌、开放空间质量),为城市规划与区域经济研究提供低成本的数据支持。

下一步:从能看能用

我们的实验也显示:经过领域适配与微调后,LVLM在多个任务上有显著提升潜力。这意味着,城市社会经济感知可能正在进入一个新阶段:从通用模型的试探性理解,走向领域模型的稳定可用

 

作者团队及合作单位

本文第一作者来自香港科技大学(广州)刘天慧,通讯作者为北京中关村学院AI+人文社会学部助理教授冯杰。该研究依托北京中关村学院自由探索项目“面向城市开放空间的空间智能与多智能体协同研究”开展,研究团队长期聚焦以城市开放空间为核心对象的空间智能及智能体技术研究,致力于推进人工智能与物理世界、人类社会的深度融合

让机器人拥有“时空记忆”,破解“断片”难题!
正式开源 | 北京中关村学院 x Hugging Face 联合发布生成式基因组大模型Carbon:一场关于“生命语言”的范式革命