跳到正文

#多模态

今日 6 条
今天9月29日周二
  1. TechCrunch · AI40

    Marissa Mayer 推出照片驱动 AI 助手 Dazzle,从相机胶卷读懂你

    前 Yahoo CEO Marissa Mayer 发布个人 AI 助手 Dazzle,它不读取邮件和日历,只通过分析手机相册来理解用户的爱好、饮食与风格偏好。Dazzle 去年 12 月完成 800 万美元种子轮融资,可通过 App 或短信交互,功能分为扫描近期照片完成即时任务,以及挖掘相册历史生成个性化度假和礼物建议。Mayer 称 Dazzle 会丢弃 AI 标记为敏感的个人信息。

  2. Latent Space78

    AMD 以 82 亿美元收购 World Labs,Atlas 解决稀疏重建问题

    AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞在回顾文章中称,公司自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并通过收购 SceniX 推进机器人仿真能力。

    推荐理由:AMD 以 82 亿美元收购 World Labs,文中同时给出 Atlas 在稀疏重建上的能力定位与机器人仿真方向。

  3. The Verge · AI75

    AMD 以逾 80 亿美元收购 World Labs

    AMD 宣布以约 82 亿美元全股票交易收购 AI 研究实验室 World Labs,交易预计年底前完成。World Labs 由知名研究者李飞飞联合创立,2024 年成立后数月内估值达 10 亿美元,2025 年推出首个商业产品——可从提示词生成交互式 3D 世界的世界生成模型 Marble。

  4. AWS Machine Learning Blog28

    在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)

    AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词经 Amazon S3 传给视频端点,最终取回 MP4,并提供命令行与 Streamlit 界面。

9月26日周六
9月25日周五
  1. Google DeepMind67

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。

    推荐理由:官方给出 Live Avatar 的实时视频对话能力、97 种语言同步与异步工具调用细节,可据此判断企业级多模态交互的落地形态。

9月24日周四
9月23日周三
9月3日周四
8月13日周四
  1. Microsoft Research38

    MindTopo:微软推出评估多模态模型拓扑空间推理能力的新基准

    微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭性、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上明显强于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成仅在单帧内保留拓扑关系时有用,跨序列仍不可靠。

8月12日周三