GaussianCity
免费
GaussianCity 是南洋理工大学 S-Lab 提出的高效无边界3D城市生成框架,基于3D高斯泼溅(3D-GS)与紧凑 BEV-Point 表示,相比 CityDreamer 速度提升 60 倍,显存消耗恒定,支持无人机与街景视角的城市场景生成。
GaussianCity 的 3D 城市生成框架
核心参数与统计
| 项目 | 详细信息 |
|---|---|
| 产品名称 | GaussianCity |
| 产品类型 | 3D 生成框架(学术研究) |
| 交付形式 | 开源代码(Python + CUDA) |
| 核心技术 | 3D Gaussian Splatting、BEV-Point |
| 论文会议 | CVPR 2025 |
| GitHub Stars | 336(截至 2025 年中) |
| 开发团队 | 南洋理工大学 S-Lab |
| 开源协议 | NTU S-Lab License 1.0 |
| 支持平台 | Linux(需 NVIDIA GPU + CUDA) |
GaussianCity 的核心突破在于将 3D-GS 从有限尺度的物体/人体生成拓展到无限尺度的 3D 城市生成。传统方法(如 CityDreamer)在大规模场景中面临显存爆炸问题——一座 10km² 的城市需要数百 GB VRAM。GaussianCity 通过 BEV-Point 紧凑表示将显存消耗维持在恒定水平,彻底打破了这一瓶颈。在推理速度上,GaussianCity 达到 10.72 FPS,是 CityDreamer(0.18 FPS)的 60 倍,属于质的飞跃。
用户与市场认可
GaussianCity 被 CVPR 2025 收录,属于 3D 生成领域的前沿研究成果。其 Hugging Face 在线演示在 2025 年第 11 周被评为 Top 8 Spaces,随后更升至 Top 1 Space,说明其在学术界与工业界均获得了广泛关注。GitHub 仓库获得 336 颗星19 个 Fork,社区活跃度在同类 CVPR 论文实现中表现突出。
该工作被 CityDreamer 同一团队(NTU S-Lab)延续推进,后续工作 CityDreamer4D 已有公开页面,表明这一技术路线具有持续的研究生命力。
成本优势
GaussianCity 是完全开源的学术研究项目,无任何付费门槛:
| 成本维度 | 说明 |
|---|---|
| 开源代码 | GitHub 仓库完全公开,基于 NTU S-Lab License 1.0 |
| 预训练模型 | 提供 Background Generator 和 Building Generator 的预训练权重 |
| 在线体验 | Hugging Face Spaces 提供免费在线 Demo |
| 硬件成本 | 需自备 NVIDIA GPU(CUDA 11.8+),训练推荐 8×GPU 多卡有境 |
对于研究者和开发者而言,真正的成本在于硬件投入。训练 Background Generator 推荐 torchrun --nnodes=1 --nproc_per_node=8 的多卡有境,单卡推理则需要至少 8GB VRAM 的 GPU。这在大模型/AIGC 研究领域属于常规配置,但对于个人爱好者门槛较高。
主要功能
- 无边界 3D 城市生成:支持从无人机鸟瞰视角到街景视角的多样化城市场景生成,场景尺度不受显存限制,理论上可达任意城市规模。
- BEV-Point 紧凑表示:将 3D 场景中的点分解为位置属性与风格属性,通过 Bird's Eye View 和风格查找表实现压缩,使 VRAM 消耗不随场景规模增长。
- 空间感知的 BEV-Point Decoder:基于 Point Serializer 和 Point Transformer 捕获 BEV 点之间的结构与上下文关系,生成高质量 3D 高斯属性。
- 双生成器架构:Background Generator(背景生成器)负责天空、地面等背景元素,Building Generator(建筑生成器)专注建筑物生成,两者配合完成完整城市场景。
- 实时渲染与交互:基于 3D-GS 的高效光栅化管线,支持实时渲染;Hugging Face Demo 提供在线交互体验。
模型与版本演进
| 版本 | 日期 | 说明 |
|---|---|---|
| 仓库创建 | 2024-05-24 | 初始仓库创建,代码尚未公开 |
| 训练/测试代码发布 | 2025-02-27 | 完整训练与推理代码、预训练权重发布 |
| Hugging Face Demo | 2025-03-02 | 在线 Demo 上线,获 Top 8 Spaces(Week 11),后续升至 Top 1 |
| CVPR 2025 收录 | 2025-06 | 论文被 CVPR 2025 接收并正式发表 |
GaussianCity 的版本脉络清晰:从 2024 年 5 月仓库初始化到 2025 年 2 月代码完整开源,再到 3 月 Hugging Face Demo 上线并获社区高热度,整体节奏紧凑。论文被 CVPR 2025 收录标志着该工作通过了顶会同行评审。目前代码仍在维护中,后续可能基于同一技术路线推出增强版本(参考同一团队的 CityDreamer4D)。
技术优势
GaussianCity 的技术领先性体现在三个层面:
- BEV-Point 紧凑表示:核心创新在于将 3D 场景点分解为位置属性与风格属性,通过 BEV 空间量化 + 风格查找表实现显存消耗恒定。相比 CityDreamer 的体素/网格表示,BEV-Point 避免了场景规模扩大时的显存指数级增长,使 10km² 级别城市生成为可能。
- 60 倍速度提升:在同等场景下,GaussianCity 的推理速度达 10.72 FPS,而 CityDreamer 仅 0.18 FPS。速度优势来自 3D-GS 的 GPU 高效光栅化管线 + BEV-Point 的紧凑数据结构,两者叠加使每帧渲染成本大幅降低。
- 空间感知解码器:Point Serializer + Point Transformer 的架构设计使 BEV 点之间的空间上下文能被有效捕获,避免了独立点生成导致的几何不一致问题,使输出城市布局合理、建筑细节丰富。
如何使用
GaussianCity 提供三种使用途径:
| 入口 | 类型 | 说明 |
|---|---|---|
| GitHub 源代码 | 自部署 | 克隆仓库 → 安装依赖 → 下载预训练模型 → 运行推理 |
| Hugging Face Demo | 在线体验 | 浏览器打开直接使用,无需任何安装配置 |
| 论文/项目页 | 参考 | arXiv 论文、项目介绍Citation 等 |
本地部署快速上手
# 1. 克隆仓库
git clone https://github.com/hzxie/GaussianCity
cd GaussianCity
# 2. 安装 PyTorch(CUDA 11.8 示例)
pip install torch==2.4.1 torchvision==0.19.1 --index-url https://download.pytorch.org/whl/cu118
# 3. 安装 Python 依赖
pip install -r requirements.txt
# 4. 编译 CUDA 扩展
GCITY_HOME=`pwd`
cd $GCITY_HOME/extensions
for e in `ls -d */`
do
cd $GCITY_HOME/extensions/$e
pip install .
done
# 5. 下载预训练模型到 output/ 目录,运行推理
python3 scripts/inference.py
注意:推理速度在
inference.py中受 CPU 端footprint_extruder限制,如需最快性能请使用 Hugging Face Demo 的 GPU 实现。
Hugging Face 在线体验
访问 https://huggingface.co/spaces/hzxie/gaussian-city 即可直接体验,无需任何配置。
产品定价
GaussianCity 是完全开源的学术项目,基于 NTU S-Lab License 1.0 协议发布,无任何收费计划:
- 开源代码:GitHub 仓库完全公开,免费使用。
- 预训练模型:Background Generator 和 Building Generator 权重免费下载。
- 在线 Demo:Hugging Face Spaces 免费体验。
- 商业授权:基于 NTU S-Lab License 1.0,商业使用需遵循该协议条款,建议咨询 NTU 团队。
实际成本主要来自硬件:
- 单卡推理:最低 8GB VRAM GPU(推荐 16GB+)
- 完整训练:推荐 8×GPU 多卡集群(A100 或同等)
应用场景
- 游戏与虚拟现实:快速生成逼真且无边界的 3D 城市有境,用于开放世界游戏VR 漫游等场景,大幅减少人工建模成本。
- 影视动画制作:高效生成复杂城市场景作为背景或特效素材,支持风格化渲染,提升制作 pipeline 效率。
- 城市规划与建筑设计:将 GIS 数据快速转化为 3D 可视化场景,辅助城市布局规划、建筑体块推敲与设计方案展示。
- 自动驾驶仿真:生成多样化的逼真城市交通场景,用于自动驾驶算法的感知与规划测试,补充常规仿真数据集难以覆盖的长尾情况。
- 地理信息系统(GIS):将二维地理数据自动升级为 3D 城市模型,支持数字孪生、智慧城市等应用的前期可视化验证。
适用人群
- 计算机视觉 / AIGC 研究者:GaussianCity 提供了 3D-GS 在城市尺度生成的前沿基线,适合用作对比方法或进一步改进的起点。
- 游戏与影视开发者:需要快速批量生成城市背景资产的技术美术和开发者,可利用开源代码和预训练模型加速资产管线。
- 自动驾驶仿真工程师:需要多样化城市场景数据用于算法验证的工程师,可基于 GaussianCity 生成补充训练数据。
- 不适用人群:
- 缺乏 GPU 算力(无 NVIDIA GPU 或 VRAM < 8GB)的个人用户不建议尝试本地部署。
- 需要即时商业级 SaaS 产品(一键生成、无需编码)的场景不适合——GaussianCity 是研究框架,使用需要 Python/CUDA 基础。
- 期待结构化城市数据(带语义标签的建筑、道路、交通流)的输出——GaussianCity 生成的是视觉渲染结果,非 GIS 结构化数据。
总结与展望
GaussianCity 是 3D 城市生成领域的一次重要突破。它将 3D-GS 的能力边界从有限尺度的物体/人体拓展到了无限尺度的城市级场景,并通过 BEV-Point 紧凑表示解决了长期困扰该领域的显存瓶颈问题。60 倍的速度提升和 CVPR 2025 的顶会背书,使其成为该方向不可绕过的基线方法。
然而,GaussianCity 定位是研究框架而非量产工具:需要 GPU 有境Python 编程基础和对 3D-GS 技术栈的理解。当前版本主要面向研究者与有技术能力的开发者,暂无可直接商用的 SaaS 版本。
采购/采用风险评估:对于个人爱好者,硬件门槛(NVIDIA GPU + CUDA + 至少 8GB VRAM)是最大的隐形投入。对于企业用户,NTU S-Lab License 1.0 的商用条款需仔细审阅,建议在商业使用前与 NTU 团队确认授权范围。项目目前由个人研究者(Haozhe Xie)维护,长期迭代节奏取决于学术团队的持续投入,存在一定程度的不确定性。建议将 GaussianCity 作为研究验证或快速原型工具使用,生产级场景仍需结合 CityDreamer 系列或其他商业化方案做对比评估。
相关工具:Midjourney、
Stable Diffusion
版本信息
- CVPR 2025 正式版本 :训练与测试代码完整发布,支持 OSM 和 GoogleEarth 数据集;Hugging Face Demo 上线(2025/03/02)。
- 仓库创建 :初始仓库创建,代码尚未公开。
用户评价