Claude Sonnet 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为更高效、单任务成本更低的 Sonnet 模型,适合聚焦编码与知识工作。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet 承担规模化任务。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为更高效、单任务成本更低的 Sonnet 模型,适合聚焦编码与知识工作。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 上的能力定位与 Opus 5.5 的分工,读者可据此判断何时选 Sonnet 承担规模化任务。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 能提升任务表现。
推荐理由:微软研究院系统测量了机器人端侧推理与卸载到边缘或云端 GPU 的差异,并给出可复用的 Kubernetes 卸载工具链。
Google DeepMind 公布 Private AI Compute 的新技术能力,将持久化服务端记忆引入该平台,使 AI 助手能在跨设备场景下保留上下文,同时维持端侧级别的隐私标准。
推荐理由:Google 公开了云端持久记忆的隐私架构,读者可了解跨设备 AI 记忆如何在服务端保持端侧级隐私。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 已在 Amazon Bedrock 正式可用,API 定价明显低于前代 GPT-5.6。
推荐理由:原文给出两款新模型在 Bedrock 上的定位与定价变化,读者可据此判断不同负载该选哪一档。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 模型家族的首个模型。
推荐理由:官方给出 Claude Opus 5.5 在 Bedrock 上的接入方式与定价变化,读者可据此评估迁移与成本。
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个合入 main 的 PR 中增量发布而非一次性切换。
推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 首次提交给出 Vera Rubin NVL72 相对 GB300 的吞吐与扩展效率数据,可据此判断下一代推理平台的性价比走向。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,用于在固定电力预算下提升 AI 工厂的 token 吞吐。
推荐理由:原文给出 DSX 各组件在真实部署中的量化结果,读者可据此判断固定电力预算下提升吞吐的可行路径。
NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 系统、DSX 平台与 NVLink 6 的多项进展,核心指标从峰值性能转向每兆瓦可验证的智能体 token 数。
推荐理由:NVIDIA 在 AI Infra Summit 集中给出 Vera Rubin、DSX 与 NVLink 6 的能效与吞吐数据,可据此判断 AI 工厂的供电与推理经济性走向。
GitHub 推出研究预览版 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级编码能力,用户可在 GitHub Copilot CLI 中通过 /experimental 选择该模型。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。