跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

4条精选相关主题多模态AI 视频产品更新

最新精选

第 1–4 条 · 共 4 条
9月25日周五
  1. Google DeepMind67

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。

    推荐理由:官方给出 Live Avatar 的实时视频对话能力、97 种语言同步与异步工具调用细节,可据此判断企业级多模态交互的落地形态。

9月23日周三
9月16日周三
9月10日周四
  1. OpenAI News65

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,支持自定义音色和电话(telephony)接入。

    推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此判断语音应用的接入方式与能力边界。