可灵4.0首发实测,国产AI视频再次掀桌?
可灵AI发布Kling 4.0,主打真实、可控、专业,在画面真实感、创意可控性与叙事完整度上大幅提升,并支持10-bit HDR、4K/1080P输出、9种语言及多关键帧编辑。同时推出Kling 4.0 Flash版本,已于9月28日开放小范围体验。
可灵AI发布Kling 4.0,主打真实、可控、专业,在画面真实感、创意可控性与叙事完整度上大幅提升,并支持10-bit HDR、4K/1080P输出、9种语言及多关键帧编辑。同时推出Kling 4.0 Flash版本,已于9月28日开放小范围体验。
同一 AWS vLLM-Omni DLC 在 SageMaker AI 部署两个端点:FLUX.2-klein-4B 实时生成图像,Wan2.1-VACE-1.3B 再异步把该图像做成短视频。
Runway 推出 GWM Worlds 2 研究预览,引入 WorldPrompt 功能以指定世界和动作,实现实时交互视频和音频生成。文章采访 CTO Kamil Sindi 和研究科学家,探讨了 autoregressive diffusion 模型和从视频生成到世界模型的工程挑战,包括 distillation 方法。
Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等框架,自动化长形式视频生成,缓解语义漂移并提升多镜头叙事一致性。
推荐理由:Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等多代理框架,自动化一致的长形式视频生成,有效缓解语义漂移和特征漂移,提升多镜头叙事一致性。
invideo 借助 GPT-6 Astra 将调色速度提升 3 倍,并能在一天内生成 50 个自定义效果。编辑规划精度也得到提高。
Higgsfield AI 借助 GPT-6 Astra 一日内上线新视频功能,让小企业视频广告创作更便捷,并加速新创意工具推向市场。
Google DeepMind 发布 Gemini Omni 1.1 Flash,面向开发者提供场景续写、首尾帧插值、视频参考和 4K 放大等生成视频控制能力。
推荐理由:相比前代只参考最后 1 秒画面,新版本可读取 10 秒上下文并把视频续写到 40 秒,开发者可据此判断生成视频的可控程度。
NVIDIA 发布 Cosmos-H-Dreams,一款基于单张 RTX PRO 6000 GPU 运行的手术机器人实时生成式仿真器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,通过 FlashDreams 推理库实现约 160 fps 的交互式操作,每潜在帧仅需 2 步去噪,支持 dVRK 桌面缝合任务,并可连接学习型手术策略形成闭环。
推荐理由:NVIDIA将手术世界模型压缩至单卡实时推理,使外科机器人策略的闭环评估与合成数据生成不再依赖稀缺物理硬件。
Google DeepMind 发布两款生成模型,Nano Banana 2 Lite 面向高吞吐的快速出图,Gemini Omni Flash 面向高质量视频生成与对话式编辑,均已上线 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。
推荐理由:Nano Banana 2 Lite 每张 1K 图 0.034 美元、Omni Flash 每秒视频 0.10 美元,读者可据此比较两款模型在图像与视频环节的成本取舍。
Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。
推荐理由:Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。