当大模型还在用文字理解世界时,高德已经让AI开始用三维空间感知世界。9月10日,高德正式发布全球首个3D原生城市世界模型ABot-Earth 0.7,将195个国家和地区的城市空间压缩进一个可连续探索的AI生成数字地球。这不仅是地图行业的里程碑,更揭示了AI创业的一个新方向——空间智能。过去十年,AI创业的主旋律是语言、图像和视频的生成;未来十年,谁能用AI生成完整、连续、可交互的三维世界,谁就可能定义下一代互联网的入口。
3D原生世界模型:从数字地球到空间智能入口
ABot-Earth 0.7的发布,让“数字地球”这个概念第一次有了真正的空间智能属性。过去二十年里,Google Earth和各类地图产品所构建的数字地球,本质上是一张巨大的“贴图”——卫星影像、航拍照片和激光点云被拼接在一起,用户只能沿着预置的浏览路线看,视角切换依赖于采集素材的多寡,城市不过是一层静止的皮。
高德这次做了完全不同的选择:不再拍摄城市,而是训练一个能“想象”城市的三维模型。ABot-Earth 0.7采用3D原生技术架构,用高德积累的海量时空数据训练模型,让AI建立对三维空间的本征理解,然后端到端输出3DGS(三维高斯泼溅)格式的城市场景。这个模型覆盖超过196个国家和地区,是目前范围最广的数字地球,但它不只是用来“看”的——高德CEO郭宁说,大模型理解语言,高德空间智能理解世界。世界存在于二维的网络拓扑、三维的空间结构,以及真实世界的流动与时间变化中,所以ABot-Earth让Earth从一个可浏览的数字球体,变成了空间智能理解真实世界的入口。
这个入口带来了交互方式的质变。在ABot-Earth中,用户不再被镜头路径束缚,而是可以连续进入街区、自由探索建筑、实时获得反馈。当你从高空俯瞰纽约中央公园,随后一路俯冲至街道,路边的招牌、建筑立面的砖缝、树荫下的光影都会随着视角切换保持一致——这恰恰是传统“拍摄-拼接”模式无法做到的事。最新科技让“在场感”从一个营销词汇,变成了技术指标。
从AI技术的演进路径来看,ABot-Earth 0.7的突破在于“原生”二字,它不是对旧地图的三维化改造,而是从数据采集、模型训练到渲染生成的整个链路都围绕三维空间重写。这意味着AI第一次真正拥有了“空间智力”,而非仅仅是“视觉拟像”。
从“拍摄粘贴”到“端到端生成”:技术路径的彻底颠覆
传统数字地球依赖一个极重的工业流程:卫星绕着地球拍,飞机对着城市拍,车辆背着激光雷达沿街拍,然后大量人工把图像、点云和矢量数据拼接对齐。这个过程耗资巨大、更新缓慢,而且永远存在盲区——那些卫星拍不到的窄巷、无人机禁飞区里的地标、车辆无法进入的室内空间,在数字地球上永远是黑盒。
ABot-Earth 0.7打破了这条路径。它不再试图穷尽拍摄现实,而是让AI学习真实世界的空间规律,再根据一张卫星图或一句文字描述,直接生成完整的3D城市场景。实测数据显示,输入一张卫星图片,模型在一块消费级GPU上只需10分钟就能生成平方公里级的3D城市,效率比传统模式提升1000倍。这个数字背后是生成范式的改变:从“复制现实”变成“理解并重构现实”,这是AI技术一次值得载入史册的跃迁。
支撑这一跃迁的,是3D原生表征与时空数据的深度耦合。高德拥有大量伴随时间变化的空间数据——哪些路在早晚高峰会拥堵,哪个商圈在节假日人流暴增,建筑在不同光照下的呈现——这些“流动”的信息让模型隐约感到真实城市不是一个静态几何体,而是一个在时间轴上连续演化的生命体。因此,ABot-Earth 0.7不仅能生成空间结构,还能补全被遮挡的立面、推测建筑可能的材质,甚至让场景中的光线和阴影遵循物理规律。
更难得的是,这个模型是“全尺寸”的。它可以在单一模型中完成从星球到城市、再到街区地标的连续生成:在城市级视距保持路网、街区与建筑群的拓扑关系,推进到近景时则还原单体建筑的轮廓、立面层次和材料质感。这种跨尺度的一致性,正是传统LOD(细节层次)技术苦苦挣扎的难题,而在3D原生的世界里,空间表征天然是连续且自洽的。对于关注最新科技动态的从业者来说,这种“一个大模型统治所有尺度”的技术路线,几乎是对传统三维重建行业的一次降维打击。
当然,端到端生成也意味着训练成本的激增。据估算,ABot-Earth 0.7的训练涉及百亿级参数和PB级时空数据,这对大多数团队来说是天文数字。但好消息是,生成端的门槛被大幅拉低——一块消费级GPU即可完成场景推理,这为后续的产业化应用铺平了道路。
AI生成效率提升1000倍,AI创业者的机会在哪里
效率提升1000倍,不只是技术指标,更是商业模式的转折点。当生成一个平方公里级3D城市场景的成本从数十万元降到几百元,原本只有政府、大厂玩得起的数字孪生工程,变成了中小团队也能入局的蓝海。这正是AI创业最性感的阶段:基础设施刚刚成熟,应用层几乎空白,谁先找到高频刚需,谁就能抢占空间智能时代的入口。
可以预见的创业方向有几种。其一是“城市级AIGC服务”:为房地产、文旅、城市规划行业提供快速生成的3D场景。过去做一个园区沙盘模型需要几周,现在用ABot-Earth类模型输入一张规划图,10分钟就能得到可漫游的数字孪生体。其二是“垂直场景交互产品”,比如用AI画图配合3D模型生成游戏场景或影视预演——游戏美术师可以用文生图快速产出贴图和概念稿,再叠加三维场景生成工具,效率直接翻倍。其三是“空间数据运营”,既然AI能把静态卫星图变成动态可交互的城市,那么把AI-images?(嗯,需要正确锚文本)等等,我们换个更贴切的方式。
实际上,AI创业不仅是搞大模型,更聪明的方式是站在巨头肩上做应用。高德提供了“城市世界模型”这个底座,创业者完全可以把它当成一个超级API,围绕垂直需求开发工具链。比如用AI图片生成快速产出建筑外貌概念图,再结合ABot-Earth生成可探索的室内外一体化场景,用于线上看房、虚拟商业街等消费级应用。又比如在景区导览场景中,把抠图技术用于照片与3D地标的创意合成,让游客在社交平台分享“虚拟旅游”内容,拉新获客就有了杀招。
更值得关注的是,AI生成的三维城市本身就是一种新的内容形态。传统UGC是文字和照片,短视频时代是视频,而空间互联网时代的内容将是“可探索的3D场景”。围绕这种内容形态,AI创业可以衍生出场景编辑工具、物体放置工具、场景风格化滤镜,甚至3D场景分享社区。这些工具恰好可以整合进AI工具导航,帮助创业者快速找到合适的AI能力组合——从生成、编辑到渲染的完整工作流,正在成为空间经济的新基础设施。
当然,技术只是杠杆,创业的胜负手始终是场景洞察。能率先把“城市世界模型”嫁接到具体行业痛点上的团队,才会是最后的赢家。
从星球到街景:全尺寸连续生成背后的技术挑战
ABot-Earth 0.7展示出的全尺寸连续生成能力,在惊艳之余也留下了技术挑战的注脚。所谓“全尺寸”,意味着模型要在同一套表征框架下处理跨度达到九个数量级的空间尺度——从行星尺度的经纬网格,到城市尺度的路网结构,再到街景尺度的门牌纹理。这种跨尺度生成在计算机图形学中一直是个结:传统方法通常把世界切成不同层级的瓦片,每层独立重建,导致用户在放大缩小过程中经常看到突兀的“跳变”。而ABot-Earth采用3D原生表征,让所有几何信息统一存在于一个连续的三维空间场中,从太空视角一路推进到街边水龙头,视觉细节都能平滑过渡。
这种能力的实现,离不开底层模型的设计创新。与当前热门的NeRF和3DGS技术不同,高德不是简单地用一个场景训练一个模型,而是训练了一个“世界级”的先验模型。它通过学习亿万张真实城市影像与多尺度几何数据的对应关系,掌握了一套可泛化的空间生成规律。当你输入一个陌生城市的卫星图时,模型不是凭记忆拼贴,而是根据这些规律推演出城市的完整三维形态,包括道路的走向、建筑的体量、甚至街道两边可能的植被分布。这正是大模型训练中“涌现能力”的三维版本——当数据规模足够大、模型容量足够深,AI开始自发地理解“城市应当如何布局”。
不过,全尺寸生成也带来了计算层面的巨大压力。为了保证结构一致性和细节精度,模型的稀疏激活和动态分辨率策略变得至关重要。在低空俯瞰时,模型用粗粒度高斯体表示街区;当镜头推进到建筑立面,它会在局部动态插入高分辨率高斯体,以补足砖缝、玻璃反光和招牌细节。这种“由粗到精”的级联生成机制,也是最近几次最新科技成果中最亮眼的工程创新之一。
但我们也必须清醒地看到,ABot-Earth 0.7仍是0.7版本,不是“1.0”。它目前能生成场景的“物”本身,但对交通流量、人流变化、天气光照等动态事件的处理还比较初步。真实城市是流动的,车辆会行驶、影子会移动、树叶会晃动,如何让3D原生世界模型具备时间维度的预测能力,是高德下一阶段的攻坚重点。而这也恰恰是AI技术红利的下一个释放点——谁能率先实现“可预测的城市动态”,谁就能让数字孪生从“可视化沙盘”升级为“真实的时空模拟器”。
另一个不可回避的问题是数据边际成本。尽管生成效率提升了1000倍,但训练高德这个“世界模型”的初始投入极其惊人:卫星影像、街景车、众包轨迹、POI数据,每一项都是高德过去十几年用真金白银铺出来的护城河。AI创业公司若想复刻这条路,难度不亚于再造一个高德;因此更现实的机会是,把这类大模型的能力封装为工具,在具体场景中做二次创新。毕竟,空间智能时代最稀缺的不仅仅是模型,还有懂行业、会用好模型的人。
飞行街景2.0落地:数字孪生不再是“样板间”
技术的价值,最终要落在产品里。ABot-Earth 0.7发布时,高德同步宣布其能力已应用于“飞行街景2.0”。用户现在打开高德地图,进入复杂建筑或大型景区,即可操控摇杆自由漫游3D场景。这不再是过去那种只能沿着预设路径平移的“伪3D”,而是一个由AI实时生成、可连续探索的立体空间。
飞行街景2.0的体验升级是巨大的。以前看景区地图,你只能在二维平面里点选几个定点全景照片,如今可以从空中俯瞰整片湖区,再一头扎进古建筑群的飞檐下,从任意角度观察木构节点和石刻细节。这种体验对旅游决策的辅助价值不言而喻——消费者在到达之前,就能获得近乎身临其境的“预体验”。在OTA平台上,酒店和景区如果能展示这种可漫游的3D场景,转化率大概率会直接翻倍。
这还只是消费端的第一个应用。在行业端,ABot-Earth类模型正在把数字孪生的市场盘子急剧做大。过去数字孪生项目多为政府示范工程,造价动辄千万,周期以年计,做完就成了“大屏样板间”。如今AI生成的3D城市可以把成本压降三个数量级,覆盖到中小城镇和商业场景。园区管理、城市应急、商业选址、物流调度,都能以极低的成本拥有一个活的三维城市底座。
对于广大的企业用户来说,3D城市世界模型相当于把“上帝视角”和“蚂蚁视角”同时交到了决策者手里。城市管理者可以在模型中模拟新建筑对街区日照的影响;商业地产商可以分析不同楼层的人流热力;影视剧组可以拖着相机在虚拟城市里提前堪景。这种“任意尺度、即时生成”的能力,正在将数字孪生的价值从可视化延伸到决策智能。
AI创业公司在这个阶段的机会,在于做“最后一公里”的交付。高德提供了大而全的底模,但每个行业的数据标注方式、交互界面需求、分析维度都千差万别。聪明的创业者可以把透明背景处理技术嵌入AR导览应用,或者把AI诗词生成器做成文化景区的趣味互动,让3D城市的墙上“长出”李白的诗。而当你需要一个高效的素材工作流,AI工具箱里那些垂直工具的组合应用,可能会比从头训练一个大模型更实用。
还有一个无法忽视的向度是C端创作。以前做3D内容是专业团队的专利,现在借助ABot-Earth的生成能力,普通用户也能在社交平台分享“我家的3D社区漫游”。当这种低门槛的内容创作成为常态,空间互联网的用户习惯就会被逐渐养成,而这恰恰是AI Agent技术未来在虚拟城市中安排NPC、设计互动剧情的前提。数字孪生,终于要从“样样间”走向“得用”了。
AI创业的新范式:从理解语言到理解世界
如果复盘过去三年AI创业的轨迹,会发现一个清晰的价值迁移:2022年,大模型学会理解语言;2023年,扩散模型学会生成图像;2024年,视频生成模型让世界“动起来”;而到了2025年,高德ABot-Earth 0.7则暗示了一个更本质的转向——让AI理解三维世界本身。
语言是世界的抽象符号,图像是世界的二维投影,而3D原生模型直指世界的本体。高德郭宁那句“大模型理解语言,高德空间智能理解世界”,并非修辞,而是路线的宣示。当AI不再依赖于人写好的坐标点,而是自己从卫星图片中衍生出完整的城市结构时,空间智能的奇点正在临近。
这种转向对AI创业的影响是结构性的。首先,“空间”成为AI时代的新石油。拥有城市级时空数据的企业,将如同前互联网时代的运营商一样占据制高点。其次,“生成3D世界”成为AI技术的核心能力之一,它会改变游戏、影视、地产、旅游、自动驾驶等多个领域的生产方式,催生出一批新的基础设施公司和平台型生态。
对AI创业者来说,一个更急迫的问题是:如何切入这个正在形成的生态位?“机会通常在‘模型与应用’之间的接缝处。”一位投资人朋友曾这样告诉我。高德把ABC(AI+BigData+City)的底牌亮了出来,但各行各业真正需要的是能解决具体问题的方案。比如,用文生图技术快速生成3D场景中的贴花与纹理,用AI画图制作城市地标的艺术化海报,用藏头诗生成器做景区文化打卡的彩蛋。这些看似“小巧”的玩法,恰恰能盘活大模型在长尾场景中的渗透率。
当然,AI创业从来不是坦途。空间智能模型的落地需要算力、数据、场景三要素的匹配,更需要对传统行业Know-how的深刻理解。“大厂做底座,创业做应用”的分工格局正在形成,但底座的迭代速度极快,应用层如果不快速建立数据飞轮和用户心智,很容易被大厂顺便下沉吃掉。最理想的姿态,是在巨头触角未伸到的垂直地带,用AI技术做到“单点极致”,再逐步横向扩展。
说到底,AI创业的底层机会一直没变:用技术边际成本的骤降,去大规模替换过去昂贵的专业服务。ABot-Earth 0.7证明,最新科技已能把3D城市生成效率提升1000倍,那么把这个逻辑复制到其他空间智能场景——室内设计、工业仿真、文物修复、虚拟偶像舞台——将有多大想象空间?或许未来某一天,每一个普通人都能拥有一个由AI养大的“世界模型”,它可以按你的心意演化出一个桃花源或一座赛博都市。那不是科幻电影,而是AI创业正在用一行行代码书写的未来。
在高德的发布会屏幕最后,“ABot-Earth 0.7”下面写着一行小字:“版本号是会变的,世界才是永恒的。”这句话送给所有AI创业路上的同行者——我们正在生成一个世界,而世界,也正在生成我们。