跳到正文

#语音

今日 3 条
今天9月29日周二
  1. TechCrunch · AI31

    Modulate 融资 2500 万美元,用小型模型阵列做语音分析与深伪检测

    波士顿语音智能初创公司 Modulate 完成 2500 万美元新融资,由 Future Ventures 领投,Hyperplane 和 Lakestar 参投。其平台运行超过 100 个模型,分为信号提取与分析检测两类,为企业提供转录、情绪分析、深伪与 AI 音乐检测,以及受监管行业语音智能体的合规执行。公司现有 40-45 名员工,计划再招 10 人加强模型建设,并正提升本地与端侧部署能力。

  2. TechCrunch · AI38

    祖父被 AI 深度伪造语音诈骗后,她创办了 DetectifAI

    Tarini Padmanabhuni 因祖父遭 AI 深度伪造语音冒充其兄弟诈骗而创办 DetectifAI,该公司设计可在手机操作系统内本地运行的紧凑 AI 模型,在通话和语音消息中即时判断声音是否为 AI 生成,音频无需离开设备。DetectifAI 以 SDK 形式授权给手机厂商作为系统内置功能,同时向企业和反欺诈公司授权,目前每月为印度金融机构处理超 10 万通电话。

9月26日周六
  1. AWS Machine Learning Blog34

    在 Amazon SageMaker AI 上部署 Qwen3-TTS 实时个性化语音

    阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 已上线 Amazon SageMaker JumpStart,可部署到全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练。该模型覆盖中文、英文、日文等 10 种语言,支持跨语言克隆与流式生成,输出 24 kHz 音频,同系列还有 CustomVoice 和 Qwen3-ASR-1.7B 可选。

9月25日周五
  1. Google DeepMind67

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。

    推荐理由:官方给出 Live Avatar 的实时视频对话能力、97 种语言同步与异步工具调用细节,可据此判断企业级多模态交互的落地形态。

9月24日周四
9月23日周三
9月16日周三
9月10日周四
  1. OpenAI News65

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,支持自定义音色和电话(telephony)接入。

    推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此判断语音应用的接入方式与能力边界。