在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用(Part 1)
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配套 Gradio 应用。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配套 Gradio 应用。
AWS 发布基于 Amazon EKS、EFA 和 DeepEP 的 MoE 强化学习训练架构,吞吐量提升 40%。该方案针对 RLHF 和 GRPO 等大规模 RL 训练中 rollout 生成与策略训练的资源竞争问题,通过 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信。
在 Amazon SageMaker HyperPod 上,用开源 RL 框架 SkyRL 对 Qwen3-VL-8B 视觉语言模型做 GRPO 后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 已上线 Amazon SageMaker JumpStart,可部署到全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练。该模型覆盖中文、英文、日文等 10 种语言,支持跨语言克隆与流式生成,输出 24 kHz 音频,同系列还有 CustomVoice 和 Qwen3-ASR-1.7B 可选。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,基于其 Taskflow Agent 框架构建。
推荐理由:原文完整披露了 Fuzzing Taskflow 的流水线设计与覆盖率反馈机制,可看到 LLM 智能体在安全测试中承担哪些判断、哪些执行。
企业可借助 Amazon Bedrock AgentCore Gateway 与 MCP 构建多账户 AI 智能体,让各业务线数据留在自有账户,仅在查询时按需流出。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的全球研究联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,读者可了解开放科学在疫情准备中的具体做法。
开源终端 AI 编程智能体 OpenCode 可接入 Amazon Bedrock 上的开放权重模型,推理在用户自己的 AWS 账户内完成,无按席位收费。文中演示了用 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 和 NVIDIA Nemotron 3 Super 120B 配置多模型工作流,并称 Ethara.AI 已用该架构在生产环境做多智能体编排。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 能提升任务表现。
推荐理由:微软研究院系统测量了机器人端侧推理与卸载到边缘或云端 GPU 的差异,并给出可复用的 Kubernetes 卸载工具链。
NVIDIA 于 9 月 22-23 日在新加坡举办 AI Day,联合合作伙伴展示东南亚区域的 AI 落地进展。新加坡 HTX 正基于 Nemotron 3 Super 与 Nemotron 3 Nano Omni 研究公共安全 AI,越南 Viettel AI 微调 Nemotron 3 Super 后在 VMLU 基准与内部产品评测中均排名第一。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,用一年英国逐小时污染数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 单个八 GPU 节点上仅用两天完成训练。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 开放学术研究免费使用。
推荐理由:AlphaGenome Atlas 把 90 亿个单核苷酸变异的预测结果做成可检索资源,读者可了解其数据规模与在罕见病研究中的实际用法。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量较首版增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP。微软同时推出持续追踪各版本计算性能的 living benchmark。
Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:Orchard 把环境层做成可复用服务,并给出三个领域的训练配方与数据,读者可据此判断小模型在真实任务上的可行边界。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核作为知识库,为 Apple Silicon 生成高质量内核。
推荐理由:读者可看到 CUDA 内核经验如何被结构化翻译到 Apple Silicon,以及翻译层对性能差距的具体贡献。