跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 1–11 条 · 共 11 条
今天9月29日周二
9月24日周四
9月23日周三
9月22日周二
9月17日周四
  1. GitHub Blog · AI & ML72

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个合入 main 的 PR 中增量发布而非一次性切换。

    推荐理由:作者以亲历者身份给出把 80 万行运行时从 TypeScript 迁到 Rust 的完整工程细节,可迁移到大规模 Agent 协作开发。

9月16日周三
  1. NVIDIA Blog62

    NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐最高达 GB300 NVL72 的 3.7 倍

    NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。

    推荐理由:MLPerf v6.1 首次提交给出 Vera Rubin NVL72 相对 GB300 的吞吐与扩展效率数据,可据此判断下一代推理平台的性价比走向。

  2. NVIDIA Blog71

    NVIDIA 在 AI Infra Summit 发布 Vera Rubin 与 DSX 平台进展,主打每瓦 token 能效

    NVIDIA 在 AI Infra Summit 上公布 Vera Rubin 系统、DSX 平台与 NVLink 6 的多项进展,核心指标从峰值性能转向每兆瓦可验证的智能体 token 数。

    推荐理由:NVIDIA 在 AI Infra Summit 集中给出 Vera Rubin、DSX 与 NVLink 6 的能效与吞吐数据,可据此判断 AI 工厂的供电与推理经济性走向。

9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 发布 Project HydraFusion:多模型编排实现前沿级编码质量

    GitHub 推出研究预览版 Project HydraFusion,通过运行时多模型编排为 Copilot 提供前沿级编码能力,用户可在 GitHub Copilot CLI 中通过 /experimental 选择该模型。

    推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三项基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。