Runway GWM Worlds 2 研究预览:WorldPrompt 实现实时世界交互
Runway 推出 GWM Worlds 2 研究预览,引入 WorldPrompt 功能以指定世界和动作,实现实时交互视频和音频生成。文章采访 CTO Kamil Sindi 和研究科学家,探讨了 autoregressive diffusion 模型和从视频生成到世界模型的工程挑战,包括 distillation 方法。
Runway 推出 GWM Worlds 2 研究预览,引入 WorldPrompt 功能以指定世界和动作,实现实时交互视频和音频生成。文章采访 CTO Kamil Sindi 和研究科学家,探讨了 autoregressive diffusion 模型和从视频生成到世界模型的工程挑战,包括 distillation 方法。
Google DeepMind 发布 Gemini Omni 1.1 Flash,面向开发者提供场景续写、首尾帧插值、视频参考和 4K 放大等生成视频控制能力。
推荐理由:相比前代只参考最后 1 秒画面,新版本可读取 10 秒上下文并把视频续写到 40 秒,开发者可据此判断生成视频的可控程度。
Google DeepMind 发布两款生成模型,Nano Banana 2 Lite 面向高吞吐的快速出图,Gemini Omni Flash 面向高质量视频生成与对话式编辑,均已上线 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。
推荐理由:Nano Banana 2 Lite 每张 1K 图 0.034 美元、Omni Flash 每秒视频 0.10 美元,读者可据此比较两款模型在图像与视频环节的成本取舍。
Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。
推荐理由:Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。