AI竞赛新焦点:奥特曼、李飞飞、张一鸣竞逐,3D空间成产业新蓝海

   时间:2026-09-08 18:32 来源:天脉网作者:冯璃月

生成式人工智能的竞争版图正在快速扩展,从二维的图片、短视频领域,延伸至更具想象力的三维空间。过去一周内,四场重要发布接连落地,三条技术路径各异的路线,不约而同地聚焦于可实时交互的3D场景构建,标志着内容产业正迈向“可进入、可交互”的新阶段。

在技术路径的探索中,OpenAI与Anthropic选择了以大语言模型(LLM)为核心的方向。这两家头部企业依托LLM的通用推理能力,切入虚拟内容生产管线,将AI能力嵌入创作者长期使用的专业软件体系,最终产出可编辑、可交互的3D场景。OpenAI推出的GPT-6 Astra模型尤为引人注目,其能力覆盖计算机操作、编程、网络安全及科学研究,能够直接操作Blender、Unreal Engine等三维创作软件,实现从概念到交付的全流程自动化。开发者社区的实测案例显示,Astra仅凭一张房屋照片,便能在Blender中还原出完整的室内空间,细节丰富,且能以接近游戏的帧率在本地运行。

Anthropic则通过MCP连接器生态,将Claude模型接入Blender、Adobe Creative Cloud等专业软件,通过Python API直接读写场景数据,实现更流畅的协同工作。Fable 5.1的发布进一步验证了这一路径的可行性,社区中涌现出大量3D游戏、场景建模的实测案例,模型能够独立完成从素材检索到成品输出的全流程。

与LLM路径不同,字节跳动选择了从视频模型向上延伸的路线。其目标不仅是生成视频内容,更是要构建可交互的虚拟空间。据彭博社报道,字节跳动正在研发一款实时空间视频生成模型,该项目由创始人亲自协调资源,最快将于10月推出。该模型能够根据用户的声音、动作实时生成虚拟环境,应用场景涵盖直播、互动短剧和游戏,并计划适配Pico VR头显。技术上,该模型以字节成熟的Seedance视频生成能力为基础,将大量空间渲染计算放在云端完成,再串流到终端设备,从而降低硬件门槛。测试数据显示,模型能够按需生成每秒20帧的视频,端到端延迟约50毫秒,这一数据已接近人类感知阈值,足以支撑流畅的沉浸式体验。

另一条值得关注的路径是原生世界模型。由李飞飞联合创立的World Labs选择了从底层重构空间理解的方向。其发布的Atlas模型是一套从零预训练的原生多模态模型,能够统一处理文本、图像、视频和相机位姿信息,构建共享空间上下文,保持三维空间逻辑一致。Atlas的核心能力在于空间重建与相机可控生成,仅需少量参考图片即可还原真实三维场景,或按指定路径生成视频。这一能力使其在影视内容制作、游戏关卡原型、数字孪生等领域具有广泛应用前景。影视从业者认为,Atlas能够显著降低前期勘景、场景预演的成本;游戏开发者则看好其在快速生成关卡背景、环境白模方面的潜力。

三条技术路径虽目标一致,但在能力禀赋、落地场景与成熟节奏上呈现出显著差异。LLM路径的核心优势在于全流程调度能力,能够服务专业创作者的生产环节;视频模型路径则更贴近大众消费场景,字节跳动凭借其内容平台与工具,有望形成从生成到分发的完整闭环;原生世界模型路径则更偏向前沿探索,其空间一致性能力为机器人仿真、工业数字孪生等领域提供了新的可能性。然而,三条路径均远未成熟,LLM路径的审美判断力、视频模型路径的稳定性、原生世界模型路径的工业标准适配性,仍是待解决的问题。随着技术的不断演进,三条路径有望在不同生产环节和场景中各自找到位置,既相互借力,也相互竞争。

 
 
更多>同类内容
全站最新
热门内容