在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词经 Amazon S3 传给视频端点,最终取回 MP4,并提供命令行与 Streamlit 界面。
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词经 Amazon S3 传给视频端点,最终取回 MP4,并提供命令行与 Streamlit 界面。
Runway 推出 GWM Worlds 2 研究预览,把高保真视频与音频生成变成实时交互式模拟,并引入 WorldPrompt 这一输入格式,可固定环境部分要素(包括首帧)并生成带时间戳的事件序列。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的实时视频对话能力、97 种语言同步与异步工具调用细节,可据此判断企业级多模态交互的落地形态。
AWS 发布基于 Strands Agents SDK 的智能体架构视频智能方案,由 Amazon Bedrock 驱动,按用户提问在运行时调度 Amazon Rekognition、Amazon Transcribe 和 Amazon Bedrock Data Automation。
Higgsfield AI 借助 GPT-6 Astra,一天内上线新视频功能,让小型企业更轻松地制作视频广告,并更快将新创意工具推向市场。