GaussianCity 免费

-

GaussianCity 是南洋理工大学 S-Lab 提出的高效无边界3D城市生成框架,基于3D高斯泼溅(3D-GS)与紧凑 BEV-Point 表示,相比 CityDreamer 速度提升 60 倍,显存消耗恒定,支持无人机与街景视角的城市场景生成。

GaussianCity 产品界面

GaussianCity 的 3D 城市生成框架

核心参数与统计

项目 详细信息
产品名称 GaussianCity
产品类型 3D 生成框架(学术研究)
交付形式 开源代码(Python + CUDA)
核心技术 3D Gaussian Splatting、BEV-Point
论文会议 CVPR 2025
GitHub Stars 336(截至 2025 年中)
开发团队 南洋理工大学 S-Lab
开源协议 NTU S-Lab License 1.0
支持平台 Linux(需 NVIDIA GPU + CUDA)

GaussianCity 的核心突破在于将 3D-GS 从有限尺度的物体/人体生成拓展到无限尺度的 3D 城市生成。传统方法(如 CityDreamer)在大规模场景中面临显存爆炸问题——一座 10km² 的城市需要数百 GB VRAM。GaussianCity 通过 BEV-Point 紧凑表示将显存消耗维持在恒定水平,彻底打破了这一瓶颈。在推理速度上,GaussianCity 达到 10.72 FPS,是 CityDreamer(0.18 FPS)的 60 倍,属于质的飞跃。

用户与市场认可

GaussianCity 被 CVPR 2025 收录,属于 3D 生成领域的前沿研究成果。其 Hugging Face 在线演示在 2025 年第 11 周被评为 Top 8 Spaces,随后更升至 Top 1 Space,说明其在学术界与工业界均获得了广泛关注。GitHub 仓库获得 336 颗星19 个 Fork,社区活跃度在同类 CVPR 论文实现中表现突出。

该工作被 CityDreamer 同一团队(NTU S-Lab)延续推进,后续工作 CityDreamer4D 已有公开页面,表明这一技术路线具有持续的研究生命力。

成本优势

GaussianCity 是完全开源的学术研究项目,无任何付费门槛:

成本维度 说明
开源代码 GitHub 仓库完全公开,基于 NTU S-Lab License 1.0
预训练模型 提供 Background Generator 和 Building Generator 的预训练权重
在线体验 Hugging Face Spaces 提供免费在线 Demo
硬件成本 需自备 NVIDIA GPU(CUDA 11.8+),训练推荐 8×GPU 多卡有境

对于研究者和开发者而言,真正的成本在于硬件投入。训练 Background Generator 推荐 torchrun --nnodes=1 --nproc_per_node=8 的多卡有境,单卡推理则需要至少 8GB VRAM 的 GPU。这在大模型/AIGC 研究领域属于常规配置,但对于个人爱好者门槛较高。

主要功能

  • 无边界 3D 城市生成:支持从无人机鸟瞰视角到街景视角的多样化城市场景生成,场景尺度不受显存限制,理论上可达任意城市规模。
  • BEV-Point 紧凑表示:将 3D 场景中的点分解为位置属性与风格属性,通过 Bird's Eye View 和风格查找表实现压缩,使 VRAM 消耗不随场景规模增长。
  • 空间感知的 BEV-Point Decoder:基于 Point Serializer 和 Point Transformer 捕获 BEV 点之间的结构与上下文关系,生成高质量 3D 高斯属性。
  • 双生成器架构:Background Generator(背景生成器)负责天空、地面等背景元素,Building Generator(建筑生成器)专注建筑物生成,两者配合完成完整城市场景。
  • 实时渲染与交互:基于 3D-GS 的高效光栅化管线,支持实时渲染;Hugging Face Demo 提供在线交互体验。

模型与版本演进

版本 日期 说明
仓库创建 2024-05-24 初始仓库创建,代码尚未公开
训练/测试代码发布 2025-02-27 完整训练与推理代码、预训练权重发布
Hugging Face Demo 2025-03-02 在线 Demo 上线,获 Top 8 Spaces(Week 11),后续升至 Top 1
CVPR 2025 收录 2025-06 论文被 CVPR 2025 接收并正式发表

GaussianCity 的版本脉络清晰:从 2024 年 5 月仓库初始化到 2025 年 2 月代码完整开源,再到 3 月 Hugging Face Demo 上线并获社区高热度,整体节奏紧凑。论文被 CVPR 2025 收录标志着该工作通过了顶会同行评审。目前代码仍在维护中,后续可能基于同一技术路线推出增强版本(参考同一团队的 CityDreamer4D)。

技术优势

GaussianCity 的技术领先性体现在三个层面:

  • BEV-Point 紧凑表示:核心创新在于将 3D 场景点分解为位置属性与风格属性,通过 BEV 空间量化 + 风格查找表实现显存消耗恒定。相比 CityDreamer 的体素/网格表示,BEV-Point 避免了场景规模扩大时的显存指数级增长,使 10km² 级别城市生成为可能。
  • 60 倍速度提升:在同等场景下,GaussianCity 的推理速度达 10.72 FPS,而 CityDreamer 仅 0.18 FPS。速度优势来自 3D-GS 的 GPU 高效光栅化管线 + BEV-Point 的紧凑数据结构,两者叠加使每帧渲染成本大幅降低。
  • 空间感知解码器:Point Serializer + Point Transformer 的架构设计使 BEV 点之间的空间上下文能被有效捕获,避免了独立点生成导致的几何不一致问题,使输出城市布局合理、建筑细节丰富。

如何使用

GaussianCity 提供三种使用途径:

入口 类型 说明
GitHub 源代码 自部署 克隆仓库 → 安装依赖 → 下载预训练模型 → 运行推理
Hugging Face Demo 在线体验 浏览器打开直接使用,无需任何安装配置
论文/项目页 参考 arXiv 论文、项目介绍Citation 等

本地部署快速上手

# 1. 克隆仓库
git clone https://github.com/hzxie/GaussianCity
cd GaussianCity

# 2. 安装 PyTorch(CUDA 11.8 示例)
pip install torch==2.4.1 torchvision==0.19.1 --index-url https://download.pytorch.org/whl/cu118

# 3. 安装 Python 依赖
pip install -r requirements.txt

# 4. 编译 CUDA 扩展
GCITY_HOME=`pwd`
cd $GCITY_HOME/extensions
for e in `ls -d */`
do
  cd $GCITY_HOME/extensions/$e
  pip install .
done

# 5. 下载预训练模型到 output/ 目录,运行推理
python3 scripts/inference.py

注意:推理速度在 inference.py 中受 CPU 端 footprint_extruder 限制,如需最快性能请使用 Hugging Face Demo 的 GPU 实现。

Hugging Face 在线体验

访问 https://huggingface.co/spaces/hzxie/gaussian-city 即可直接体验,无需任何配置。

产品定价

GaussianCity 是完全开源的学术项目,基于 NTU S-Lab License 1.0 协议发布,无任何收费计划:

  • 开源代码:GitHub 仓库完全公开,免费使用。
  • 预训练模型:Background Generator 和 Building Generator 权重免费下载。
  • 在线 Demo:Hugging Face Spaces 免费体验。
  • 商业授权:基于 NTU S-Lab License 1.0,商业使用需遵循该协议条款,建议咨询 NTU 团队。

实际成本主要来自硬件:

  • 单卡推理:最低 8GB VRAM GPU(推荐 16GB+)
  • 完整训练:推荐 8×GPU 多卡集群(A100 或同等)

应用场景

  • 游戏与虚拟现实:快速生成逼真且无边界的 3D 城市有境,用于开放世界游戏VR 漫游等场景,大幅减少人工建模成本。
  • 影视动画制作:高效生成复杂城市场景作为背景或特效素材,支持风格化渲染,提升制作 pipeline 效率。
  • 城市规划与建筑设计:将 GIS 数据快速转化为 3D 可视化场景,辅助城市布局规划、建筑体块推敲与设计方案展示。
  • 自动驾驶仿真:生成多样化的逼真城市交通场景,用于自动驾驶算法的感知与规划测试,补充常规仿真数据集难以覆盖的长尾情况。
  • 地理信息系统(GIS):将二维地理数据自动升级为 3D 城市模型,支持数字孪生、智慧城市等应用的前期可视化验证。

适用人群

  • 计算机视觉 / AIGC 研究者:GaussianCity 提供了 3D-GS 在城市尺度生成的前沿基线,适合用作对比方法或进一步改进的起点。
  • 游戏与影视开发者:需要快速批量生成城市背景资产的技术美术和开发者,可利用开源代码和预训练模型加速资产管线。
  • 自动驾驶仿真工程师:需要多样化城市场景数据用于算法验证的工程师,可基于 GaussianCity 生成补充训练数据。
  • 不适用人群
    • 缺乏 GPU 算力(无 NVIDIA GPU 或 VRAM < 8GB)的个人用户不建议尝试本地部署。
    • 需要即时商业级 SaaS 产品(一键生成、无需编码)的场景不适合——GaussianCity 是研究框架,使用需要 Python/CUDA 基础。
    • 期待结构化城市数据(带语义标签的建筑、道路、交通流)的输出——GaussianCity 生成的是视觉渲染结果,非 GIS 结构化数据。

总结与展望

GaussianCity 是 3D 城市生成领域的一次重要突破。它将 3D-GS 的能力边界从有限尺度的物体/人体拓展到了无限尺度的城市级场景,并通过 BEV-Point 紧凑表示解决了长期困扰该领域的显存瓶颈问题。60 倍的速度提升和 CVPR 2025 的顶会背书,使其成为该方向不可绕过的基线方法。

然而,GaussianCity 定位是研究框架而非量产工具:需要 GPU 有境Python 编程基础和对 3D-GS 技术栈的理解。当前版本主要面向研究者与有技术能力的开发者,暂无可直接商用的 SaaS 版本。

采购/采用风险评估:对于个人爱好者,硬件门槛(NVIDIA GPU + CUDA + 至少 8GB VRAM)是最大的隐形投入。对于企业用户,NTU S-Lab License 1.0 的商用条款需仔细审阅,建议在商业使用前与 NTU 团队确认授权范围。项目目前由个人研究者(Haozhe Xie)维护,长期迭代节奏取决于学术团队的持续投入,存在一定程度的不确定性。建议将 GaussianCity 作为研究验证或快速原型工具使用,生产级场景仍需结合 CityDreamer 系列或其他商业化方案做对比评估。

相关工具:MidjourneyStable Diffusion

版本信息

  • CVPR 2025 正式版本 :训练与测试代码完整发布,支持 OSM 和 GoogleEarth 数据集;Hugging Face Demo 上线(2025/03/02)。
  • 仓库创建 :初始仓库创建,代码尚未公开。

用户评价

  • 加载评价中...