跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 1–4 条 · 共 4 条
今天9月29日周二
  1. Latent Space78

    AMD 以 82 亿美元收购 World Labs,Atlas 解决稀疏重建问题

    AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞在回顾文章中称,公司自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并通过收购 SceniX 推进机器人仿真能力。

    推荐理由:AMD 以 82 亿美元收购 World Labs,文中同时给出 Atlas 在稀疏重建上的能力定位与机器人仿真方向。

9月25日周五
  1. Google DeepMind67

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。

    推荐理由:官方给出 Live Avatar 的实时视频对话能力、97 种语言同步与异步工具调用细节,可据此判断企业级多模态交互的落地形态。

9月23日周三
9月3日周四