在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用(Part 1)
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配套 Gradio 应用。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配套 Gradio 应用。
AWS 发布教程,演示在 SageMaker AI 上从同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成。文本提示词先生成 PNG,再连同运动提示词经 Amazon S3 传给视频端点,最终取回 MP4,并提供命令行与 Streamlit 界面。
AWS 介绍了一种基于 Amazon Nova Act 和 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,通过将适配器 ID 外置到 AWS Systems Manager Parameter Store,生产环境适配器引用更新无需重新部署应用,原本需数小时至数天的协调工作缩短至数秒。
Simon Willison 用 Claude Opus 5.5 将三张 kākāpō 鹦鹉照片生成为 HTML5 canvas 像素动画 Kākāpō Party,画面中至少 20 只鹦鹉随音乐跳跃、撒彩带。
GitHub Copilot 应用中的 canvas(画布扩展)是一种用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘。在 agent 会话中输入 /create-canvas 并用自然语言描述工作流、界面操作和智能体权限,即可生成界面并在右侧面板打开,无需手写代码。
AWS 发布基于 Amazon EKS、EFA 和 DeepEP 的 MoE 强化学习训练架构,吞吐量提升 40%。该方案针对 RLHF 和 GRPO 等大规模 RL 训练中 rollout 生成与策略训练的资源竞争问题,通过 DeepEP 优化 Expert Parallelism 在 EFA 上的 all-to-all 通信。
在 Amazon SageMaker HyperPod 上,用开源 RL 框架 SkyRL 对 Qwen3-VL-8B 视觉语言模型做 GRPO 后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 走并行批处理路径。
阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 已上线 Amazon SageMaker JumpStart,可部署到全托管实时推理端点,仅凭几秒参考音频和对应文本即可克隆音色,无需重新训练。该模型覆盖中文、英文、日文等 10 种语言,支持跨语言克隆与流式生成,输出 24 kHz 音频,同系列还有 CustomVoice 和 Qwen3-ASR-1.7B 可选。
Simon Willison 发布 commit-rewriter 0.2。该工具与 git 相关,具体功能与更新细节原文未作说明。
AWS 发布 WhisperX Deep Learning Container,在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的逐词时间戳和说话人分离,可部署到 Amazon SageMaker AI 实时或异步端点,无需自建镜像。
企业可借助 Amazon Bedrock AgentCore Gateway 与 MCP 构建多账户 AI 智能体,让各业务线数据留在自有账户,仅在查询时按需流出。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。代码行沿用“绘制前高度已知”的确定性几何,评论等动态块则改为惰性测量、高度有界、修正锚定在用户当前视口,避免滚动跳动。
AWS 发布基于 Strands Agents SDK 的智能体架构视频智能方案,由 Amazon Bedrock 驱动,按用户提问在运行时调度 Amazon Rekognition、Amazon Transcribe 和 Amazon Bedrock Data Automation。
开源终端 AI 编程智能体 OpenCode 可接入 Amazon Bedrock 上的开放权重模型,推理在用户自己的 AWS 账户内完成,无按席位收费。文中演示了用 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 和 NVIDIA Nemotron 3 Super 120B 配置多模型工作流,并称 Ethara.AI 已用该架构在生产环境做多智能体编排。
一份可交互的讲解材料,用实例演示 Shadow DOM 的样式封装、继承、slots、parts 以及 JavaScript 访问方式,展示 shadow root 如何创建带私有样式表和元素的隔离 DOM 树,并以特定受控方式与页面 DOM 交互。该材料由 Fable 5.1 Medium 根据提示词生成。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个合入 main 的 PR 中增量发布而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。
GitHub 日本和韩国区营销负责人把活动运营流程交给 GitHub Copilot,用 GitHub Issue 表单、Labels 触发器和 Actions 工作流搭出一套自动化管线:活动从单个 Issue 自动建站、生成 UTM 链接、每日筛选报名者并在结束后自动清理。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览 AI 智能体生成的代码变更。diff 面板以绿色和红色高亮显示增删改内容,终端面板支持运行命令和配置脚本,浏览器面板提供 Pick & Polish 工具用于选取元素并让智能体调整。完成审查、运行和预览后,用户可直接在应用内接受变更并创建 pull request。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前方法多由外部固定并行结构,模型无法自行决定何时分解任务、开多少线程。文章重点讨论自适应并行推理,并提及 ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法。