首页 / 资讯详情
形界智能:沿用两段式架构,是市场对 AI 实时视频的最大误判
摘要
作者|Cynthia 编辑|郑玄 投资人广撒网式布局,但真正的全域沉浸式生成,还少之又少。 2024 年 8 月 27 日,DOOM 里的一声枪响,在 2026 年年中的资本市场,听到了震耳欲聋的回响。 这一天,一段《DOOM》的游戏画面出现在 Google Research、Google DeepMind 和特拉维夫大学研究团队公布的演示里。 棕红色的墙壁,幽暗的走廊,像素化的枪口,玩家移动,怪物出现。然后,玩家按下键盘,枪响了。 如果不去细看,这段演示与三十年来无数次《DOOM》游戏录像没有任何本质区别。 变化发生在屏幕背后:那里没有一个传统游戏引擎,玩家扣动扳机之后,会出现什么画面,全是靠模型在毫秒内自行推演出的。 于是,过去互联网时代短视频 vs 直播的叙事,在 AI 视频生成赛道再次重演。 但很可惜,由于成本以及谷歌内部的诸多考虑,那声枪响,很快被离线生成视频带来的掌声盖住。此后一年里,行业的聚光灯逐渐集中到了 Sora、可灵、Seedance 这样的离线生成模型玩家之上。围绕分辨率、镜头语言、人物一致性和生成时长,整个行业都在研究如何把十秒钟的视频做得更像电影。 但枪声并没有消失,穿行了整整两年,在今年年中的资本市场,实时视频生成终于迎来了史无前例的爆发。 01 一张拥挤的牌桌,与行业的第三条路线 2026 年 8 月 13 日,Anthropic 被曝:正洽谈以约 60 亿美元收购实时视频生成的初创公司 Decart。 消息如涟漪般扩散,层层传导共振。从美国到中国,从创业到投资,从内容社区到世界模型,实时生成视频成了行业的当红炸子鸡:2026 年过去的七个月里,融资消息几乎以周为单位发生,从 Runway 到 World Labs;从 Decart 到 Odyssey,单轮融资两三亿美金,已经成为行业常态。 在美国,大量产业投资人会选择多头下注 桌上筹码越堆越高,但比金额更值得玩味的是出资方名单。英伟达、AMD 同时出现在 World Labs 与 Runway 的股东席上,Adobe 押注 Runway 与 Decart,亚马逊、自动驾驶玩家站在 Odyssey 身后,丰田、红杉、Benchmark 围在 Decart 桌边。 一张拥挤的牌桌上,坐满了焦虑的投资人,野心勃勃的创业者,新一代技术极客,以及翘首以待的游戏、直播、教育乃至自动驾驶与具身智能行业的玩家。 他们都在等一个信号:门什么时候打开,又将被谁打开。 而接下来最关键的事情,无非是桌面上的三派玩家,他们更愿意押注在哪一个。 字节跳动的 Seedance、快手的可灵、生数科技的 Vidu 为代表的第一类玩家,将替代实拍、剪辑与特效卷到极致后,便开始不断增加视频的清晰度与时长。但这条路只改变了生产方式,视频依然是一段被提前做好、供人观看的成品,观众永远坐在屏幕外面。 第二条路上的玩家试图打破这面墙。World Labs、Odyssey,还有国内的爱诗科技、智象未来,都在往实时流式生成的方向走。它们要做的是一个可以实时演化的数字世界:你可以操控视角、改变环境、用指令让世界长出新的地貌。它把人从观众变成了玩家,但仍 需要用户通过键盘、鼠标和 Prompt 驱动内容生成, 进入的门槛依然还在。 很快,在第二条路线的基础之上,又分化出了第三条路线:他们管自己叫做 全域沉浸式生成,即 Immersive;这个词也恰好是《头号玩家》中绿洲(OASIS)全称的第四个单词。 代表玩家是形界智能的 Rise 系列。它的核心逻辑是:交互的终极形态,不是人去适应模型,而是模型来适应