Runway披露GWM Worlds 2工程细节:双向扩散改造成实时世界引擎,50步去噪蒸馏到4步

新闻2周前更新 ai30guanwang
15 0
Runway GWM Worlds 2 实时世界模型 配图
生成式视频正在从「看」变成「玩」(配图:AI30媒体部)

文生视频卷完画质之后,赛道正在换方向:让生成的世界可以实时「玩」。Runway 的研究预览 GWM Worlds 2 能以 720p、24 帧每秒连续流式输出视频,同时配上 48,000Hz 的同步音频,用户用文字就能现场指挥画面里的角色、天气和镜头。最近,Runway 联合创始人兼联席 CEO Anastasis Germanidis 与首席研究科学家 Robin Kahlow 在一次访谈中把这套系统的工程细节讲透了,信息量不小。

从文生视频到可玩世界:720p@24fps 实时流

先看它在做什么。去年 12 月 Runway 首次展示 GWM Worlds 时,主打的是实时环境模拟和长序列运动中的空间一致性;到了 GWM Worlds 2,生成能力被正式改造成交互运行时——你定义环境、主体、视觉风格、物理规则和氛围,进入世界之后用文字动作指挥任何一个主体或整个场景:一次挥剑、一句台词、一场把房间淹没的洪水、一场滚过来的沙尘暴,世界从每个新输入继续生成,会话没有预设长度。同一场戏还能双开:一个人扮玩家控制幸存者走位,另一个人扮导演让营火变旺、把日落淡成星空。这条路线上的对手也都是熟面孔:谷歌 DeepMind 的 Genie 3、World Labs 的 RTFM、Odyssey-2 Pro,卷的都是「实时可交互」这一项。

工程改造:双向扩散转自回归,50步去噪蒸馏到4步

工程上最关键的一步,是把双向扩散模型改造成自回归管线。扩散模型本来是拿到完整片段后一次性反推整段视频,不适合边输入边输出;Runway 把它重训成自回归形态,随时间一帧一帧(或一小批一小批)顺序生成,模型因此能直接响应连续的用户输入。但自回归只是解决了结构问题,实时帧率还要靠后训练蒸馏来换:Germanidis 透露,蒸馏把去噪步数从大约 50 步压到 4 步,用轻微的质量折价换取实时性能——这也是当下实时生成系统的通用打法。

WorldPrompt:持久世界上下文+带时间戳的事件流

怎么控制这个世界?Runway 给出的答案是 WorldPrompt,一个双层输入表示。核心洞察是:一个世界可以拆成「什么保持不变」和「什么随时间变化」两类状态。持久层是一个 genesis prompt,包含场景描述(环境、布局、材质、光照、环境音)、可参与事件的主体及其属性,以及支配行为的「法则」——从重力碰撞到角色能力和镜头视角,再加一帧首帧画面给生成提供视觉锚点;变化层是带时间戳的事件流,每个动作都是自由文本提示,带起止时间戳,发给某个主体或场景本身,多个动作可以自由重叠,台词也只是一种普通的动作。官方示例里,一段街头对话的场景、两位角色、第三人称镜头法则,全用这种方式结构化描述,模型照着执行。

没解决的问题:误差累积、显存与反事实

难啃的问题也都摆在明面上。首先是误差累积:自回归视频生成里,每一帧新画面都会回喂给网络当下一步的上下文,轻微的瑕疵和不一致会随会话拉长不断复合,Germanidis 称其为自回归建模的根本缺陷;其次是显存,无限时长生成需要激进的优化策略来决定保留哪些上下文历史、丢弃哪些 token,否则 GPU 内存会被耗尽;长期记忆同样是未解难题,元素移出视野后环境难以完美保持。还有一个更隐蔽的坑是反事实正确性:网络训练数据自带采样偏差——足球集锦里射门多、进球也多,但真正的世界模型必须对任意分支的动作都生成同样合理的视觉后果,这类多提示、多角色的交互评估需要自动化可验证测试加人工压测一起上。

为什么值得盯:智能体仿真、合成数据与GEO视角

为什么值得内容和技术团队都盯一眼?对游戏和影视行业,实时世界模型意味着预演、虚拟制片和可反复改戏的场景沙盒;对 AI 研发,Runway 强调智能体仿真和合成训练数据——一次性生成成千上万路多样化的模拟摄像头画面,让智能体像在真实世界一样只靠像素和音频理解环境,而不是依赖物理引擎吐出的结构化数值。Germanidis 还提到一个「界面世界模型」的概念:把软件前端渲染成像素并实时响应点击、拖拽和滚动。生成式引擎从「回答问题」进化到「实时生成世界」,内容被消费的方式正在被改写——这也是做 GEO 的人需要持续跟踪世界模型这条线的理由。想看生成式视频赛道的其余玩家,可以参考我们对Runway的收录页,以及国内代表性产品可灵AI的收录页。

(文 / AI30媒体部 | 2026年9月26日)

© 版权声明

相关文章

暂无评论

none
暂无评论...