Runway 发布 GWM Worlds 2 与 WorldPrompt:实时世界模型的工程实现
Runway 推出 GWM Worlds 2 研究预览,把高保真视频与音频生成变成实时交互式模拟,并引入 WorldPrompt 这一输入格式,可固定环境部分要素(包括首帧)并生成带时间戳的事件序列。
Runway 推出 GWM Worlds 2 研究预览,把高保真视频与音频生成变成实时交互式模拟,并引入 WorldPrompt 这一输入格式,可固定环境部分要素(包括首帧)并生成带时间戳的事件序列。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、97 种语言同步与异步工具调用细节,可据此判断企业级多模态交互的落地形态。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供场景延展、首尾帧插值、360p 快速草稿和最高 4K 上采样等生成视频控制能力,通过 Gemini API 在 Google AI Studio 提供。
推荐理由:官方给出场景延展、首尾帧插值与 4K 上采样等具体能力与开放入口,可据此判断生成视频工作流的可控性变化。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款新模型给出延迟、单价与开放入口,读者可据此判断图像与视频生成链路的成本与可用性。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,读者可据此判断视频生成工作流的变化。