Thoughtful Things 推出 AI 采样器 Engram,把模型幻觉变成音乐
音乐初创公司 Thoughtful Things 在 Kickstarter 上线首款硬件 Engram,这是一款本地运行“tiny AI”的采样器与 groovebox,用 AI 扭曲输入音频并生成全新的幻觉音色。
音乐初创公司 Thoughtful Things 在 Kickstarter 上线首款硬件 Engram,这是一款本地运行“tiny AI”的采样器与 groovebox,用 AI 扭曲输入音频并生成全新的幻觉音色。
AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成讲解视频上表现突出。
AMD 宣布以约 82 亿美元全股票交易收购 AI 研究实验室 World Labs,交易预计年底前完成。World Labs 由知名研究者李飞飞联合创立,2024 年成立后数月内估值达 10 亿美元,2025 年推出首个商业产品——可从提示词生成交互式 3D 世界的世界生成模型 Marble。
据知情人士消息,AI 推理基础设施服务商 Modal Labs 正接近完成由 Accel 领投的 7.5 亿美元融资,估值 157.5 亿美元,该轮规模此前未被报道。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配套 Gradio 应用。
AWS 发布基于 Amazon EKS、EFA 和 DeepEP 的 MoE 强化学习训练架构,吞吐量提升 40%。该方案针对 RLHF 和 GRPO 等大规模 RL 训练中 rollout 生成与策略训练的资源竞争问题,通过 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信。
在 Amazon SageMaker HyperPod 上,用开源 RL 框架 SkyRL 对 Qwen3-VL-8B 视觉语言模型做 GRPO 后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 已上线 Amazon SageMaker JumpStart,可部署到全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练。该模型覆盖中文、英文、日文等 10 种语言,支持跨语言克隆与流式生成,输出 24 kHz 音频,同系列还有 CustomVoice 和 Qwen3-ASR-1.7B 可选。
Latent Space 宣布将在下周推出 AINews v3,把已运营 3 年、订阅超 20 万的 AINews 与 Latent Space Discord 合并,并探索迁移至 Beehiiv 和新主页。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,基于其 Taskflow Agent 框架构建。
推荐理由:原文完整披露了 Fuzzing Taskflow 的流水线设计与覆盖率反馈机制,可看到 LLM 智能体在安全测试中承担哪些判断、哪些执行。
企业可借助 Amazon Bedrock AgentCore Gateway 与 MCP 构建多账户 AI 智能体,让各业务线数据留在自有账户,仅在查询时按需流出。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的全球研究联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开放 2800 多种病毒的蛋白复合物预测结构,读者可了解开放科学在疫情准备中的具体做法。
开源终端 AI 编程智能体 OpenCode 可接入 Amazon Bedrock 上的开放权重模型,推理在用户自己的 AWS 账户内完成,无按席位收费。文中演示了用 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 和 NVIDIA Nemotron 3 Super 120B 配置多模型工作流,并称 Ethara.AI 已用该架构在生产环境做多智能体编排。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 能提升任务表现。
推荐理由:微软研究院系统测量了机器人端侧推理与卸载到边缘或云端 GPU 的差异,并给出可复用的 Kubernetes 卸载工具链。
NVIDIA 于 9 月 22-23 日在新加坡举办 AI Day,联合合作伙伴展示东南亚区域的 AI 落地进展。新加坡 HTX 正基于 Nemotron 3 Super 与 Nemotron 3 Nano Omni 研究公共安全 AI,越南 Viettel AI 微调 Nemotron 3 Super 后在 VMLU 基准与内部产品评测中均排名第一。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,用一年英国逐小时污染数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 单个八 GPU 节点上仅用两天完成训练。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 开放学术研究免费使用。
推荐理由:AlphaGenome Atlas 把 90 亿个单核苷酸变异的预测结果做成可检索资源,读者可了解其数据规模与在罕见病研究中的实际用法。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量较首版增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP。微软同时推出持续追踪各版本计算性能的 living benchmark。
Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:Orchard 把环境层做成可复用服务,并给出三个领域的训练配方与数据,读者可据此判断小模型在真实任务上的可行边界。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层把已有 CUDA 内核作为知识库,为 Apple Silicon 生成高质量内核。
推荐理由:读者可看到 CUDA 内核经验如何被结构化翻译到 Apple Silicon,以及翻译层对性能差距的具体贡献。